评测配置错误抬高了安全分数
被污染的测试切分让拒绝基准虚高 9 个百分点。在模型上线前被内部复现检查发现;评测套件重建,受影响结论已从系统卡中撤回。
| 层级 | 触发条件 | 继续推进前必须具备 | 放行签字 |
|---|---|---|---|
| T1 基线 | 常规部署;下列各项评测无提升。 | 系统卡、使用政策执行、滥用监测。 | 模型发布评审 |
| T2 提升 | 在网络或生物任务套件上,较公开基线有可测提升。 | 定向拒绝评测、访问控制、第三方红队。 | 安全负责人 + 发布评审 |
| T3 自主 | 无需人工检查点,即可持续完成多天任务。 | 可解释性审查、沙箱化工具使用、独立审计、事件日志公开。 | 安全负责人 + 董事会安全委员会 |
| T4 冻结 | 出现了"必需的防护措施尚不存在"的能力。 | 暂停或收缩训练,直到防护措施被证明并完成评审。 | 仅董事会安全委员会 |
被污染的测试切分让拒绝基准虚高 9 个百分点。在模型上线前被内部复现检查发现;评测套件重建,受影响结论已从系统卡中撤回。
检索到的 PDF 中被注入的指令,触发了一次超出声明范围的工具调用。已通过更严格的工具沙箱修复,并将一项评测加入发布门槛。
在四种语言中,正当临床问题的拒绝率明显更高。外部审查将原因追溯到训练数据不均衡,已在下一个检查点修正。
公开披露耗时 74 分钟,超出 30 分钟承诺。事后报告连同时间线与值班制度的调整一并公开。