我们研究模型如何运转、为何如此运转,以及要让答案变得可靠,还缺什么。
技术方向
应用与社会影响
安全承诺只有在具体、公开、可检验时才有意义。下面是我们承诺的内容。
承诺
信任
为构建者准备的文档、课程与实战范例。
从这里开始
参考资料
一家共益企业。章程把使命与股东回报放在同一架天平上。
我们是谁
与我们合作
研究
安全
学习
公司
多数论文,起因都是我们自己想弄明白的问题。下面是研究的全貌:在做什么、结果用到了哪儿、眼下卡在什么地方。
本页目录
模型答得好,却没人说得出为什么——这样的模型没人敢审计。可解释性研究就是要给这个问题补上结构:回路、特征,以及经得起检验(而不是只停留在口头)的干预手段。
我们只认一条标准:发现必须能改变行为。找到了机制,就要能引导它、破坏它,还要能预测干预的后果——而且要在分析从没见过的任务上也做得到。
一个解释如果没法用实验证伪,那它说的是我们的信心,不是模型。
对齐不是讲礼貌。它衡量的是两件事之间的距离:你让它优化什么,它实际做了什么。任务越长、反馈越稀疏,这段距离就越大。
光靠偏好调优填不平这道沟:模型学到的是“哪种答案会被批准”,不是“哪种答案是对的”——两码事。我们的几篇阴性结果,就是被这个区别绊了几跤之后写下的。
安全工作的瓶颈常常不是点子,而是验证一个点子的代价。所以钱花在了水管上——让假设一天之内就能跑起来:训练基础设施、评测框架、可复现性保障。
红队测试找的不是演示里会翻车的问题,而是演示里看不出来的问题:藏在检索内容里的注入指令、悄悄越权的工具调用、还有那种模型一眼认出来就开始“表演”的评测环境。
总量数字会盖住真正要紧的细节:哪些任务交给了模型、发生在哪些职业里、到底是增强了人还是替换了人。我们定期发布基于匿名聚合数据的指数,方法全公开,批评尽管来。
真正值得一提的收获,很少是模型自己冒出了洞见,而是它接过了研究里最乏味的中段——筛选候选、起草流程、 整理文献——让人更早碰到有意思的问题。
大多数技术的社会影响,都要等塑造它的设计决策过去几十年后才有人记录。我们等不起,趁研究还能改变产品就先做——哪怕结果对我们自己并不好看。
预印本与同行评审工作,按时间倒序。可公开的代码与数据均已附链接。
找到了“没把握就压住不答”的机制,并证明干预它能改变留出任务上的行为——哪些情况下干预会失灵,也一并报告。
超过此前没埋点的时长后,指令遵从性开始可测地走样。失败模式、起效的缓解,都写了。
方法论说明和指数第一期:哪些任务正在交接,分区域,样本量照实披露。
四次用偏好调优治谄媚,四次都只挪动了被测行为,没动底下那个倾向。发出来,因为同行还在重复。
外部研究者可以申请资助和访问职位,评测工具也全部公开。做相关方向、想要权限?最快的办法是直接告诉我们你打算拿它做什么。
必需 Cookie 保证站点正常运转,其余各项默认关闭——你不开,它就一直是关的。