研究

总览 可解释性 对齐科学 经济研究

安全

承诺 负责任扩展 信任中心

学习

学院 开发者文档 模型 新闻

公司

关于 招贤纳士 联系我们
体验共振 登录

经得起生产环境检验的研究。

多数论文,起因都是我们自己想弄明白的问题。下面是研究的全貌:在做什么、结果用到了哪儿、眼下卡在什么地方。

项目方向
7 个从回路到劳动力市场度量。
发表论文
140+ 篇同行评审与预印本,有代码的都附带代码。
评测套件
60+ 套发布前运行,阈值移动时重跑。
信息披露
100%每个发布的模型都随附公开系统卡。
2026 年 7 月 24 日

一个可引导的"保留答案"回路

找到了“没把握就压住不答”的机制,并证明干预它能改变留出任务上的行为——哪些情况下干预会失灵,也一并报告。

可解释性 代码 预印本
阅读论文
2026 年 6 月 2 日

多天智能体任务中的漂移

超过此前没埋点的时长后,指令遵从性开始可测地走样。失败模式、起效的缓解,都写了。

对齐 评测
阅读论文
2026 年 4 月 19 日

AI 使用型劳动力市场中的任务级暴露

方法论说明和指数第一期:哪些任务正在交接,分区域,样本量照实披露。

经济学 数据集
阅读论文
2026 年 3 月 7 日

偏好优化中的阴性结果

四次用偏好调优治谄媚,四次都只挪动了被测行为,没动底下那个倾向。发出来,因为同行还在重复。

对齐 阴性结果
阅读论文
与我们共事

研究是一种集体活动,我们希望房间里人多一些。

外部研究者可以申请资助和访问职位,评测工具也全部公开。做相关方向、想要权限?最快的办法是直接告诉我们你打算拿它做什么。