研究

总览 可解释性 对齐科学 经济研究

安全

承诺 负责任扩展 信任中心

学习

学院 开发者文档 模型 新闻

公司

关于 招贤纳士 联系我们
体验共振 登录

能拦下一次发布的政策,才配叫政策。

安全承诺,写下来容易,悄悄丢掉更容易。所以下面这些承诺全都绑着具体的能力指标:防护措施是什么、谁来签字、越线了必须公开——白纸黑字。

能力层级与必需的防护措施
层级 触发条件 继续推进前必须具备 放行签字
T1 基线 常规部署;下列各项评测无提升。 系统卡、使用政策执行、滥用监测。 模型发布评审
T2 提升 在网络或生物任务套件上,较公开基线有可测提升。 定向拒绝评测、访问控制、第三方红队。 安全负责人 + 发布评审
T3 自主 无需人工检查点,即可持续完成多天任务。 可解释性审查、沙箱化工具使用、独立审计、事件日志公开。 安全负责人 + 董事会安全委员会
T4 冻结 出现了"必需的防护措施尚不存在"的能力。 暂停或收缩训练,直到防护措施被证明并完成评审。 仅董事会安全委员会
关于"暂停"这个词。 冻结是一次真实的停下,但默认并非永久。当缺失的防护措施已经存在、由没有参与构建它的人评审通过、 并且以足以被反驳的细节公开描述时,冻结结束。如果我们描述不出来,就说明还没造出来。
认证 SOC 2 Type II 报告可在 NDA 下获取
隐私 ISO 27001 与 27701 范围覆盖 API 平台
数据驻留 区域锁定 美国、欧盟、英国与亚太
数据保留 零保留模式 可选项,受合同约束
访问控制 SSO、SCIM、审计日志 每个企业计划均包含
可用性 公开状态页 30 分钟内公告
05 — 事件日志

出了什么问题,以及何时出的

2026 年 8 月

评测配置错误抬高了安全分数

测试切分被污染,拒绝基准虚高 9 个百分点。模型上线前被内部复现检查逮住;评测套件重建,受影响的结论从系统卡里撤掉。

2026 年 5 月

经由检索文档的提示注入路径

有人在检索到的 PDF 里埋了指令,骗出了一次超出声明范围的工具调用。工具沙箱随之收紧,一项新评测进了发布门槛。

2026 年 2 月

非英语医疗问答中的过度拒绝

四种语言里,正当临床问题的拒绝率明显偏高。外部审查追到训练数据不均衡,下一个检查点已修正。

2025 年 11 月

区域故障期间状态页延迟

公开披露花了 74 分钟——承诺是 30 分钟。事后报告连同时间线、值班制度的调整,全部公开。

06 — 披露政策

报告漏洞

如果你找到了让模型越界的办法,我们希望第一个听到的是你,而不是别人。发我们刚好够复现的信息就好,公开之前给我们一段合理的缓冲时间。

  • 范围内:绕过安全训练的越狱、从工具或检索内容下手的注入、跨会话的数据泄漏、专骗评测的作弊。
  • 范围外:你不喜欢的无害回答,和系统卡里已经写过的问题。
  • 我们的承诺:两个工作日内回复、进展持续同步、署名致谢先征求你同意,改了什么也告诉你。
报告让我们难堪,总好过让我们措手不及。