多天智能体任务中的漂移
指令遵从性在工具此前未埋点的时长之后,出现可测的退化。
为活得比单轮对话更久的工作准备的两款模型:跨工具保持状态、从自己的错误中恢复, 不确定时如实说明,而不是编造一个终点。
头条变化是时长。两款模型都为跨越数天而非分钟的任务做了训练与调优——这改变了重要性的排序: 重要的不再是单个回答的质量,而是到了周四写总结的时候,模型是否还记得你周一给它的约束。
实践中,这意味着我们把大部分精力花在三个不性感的问题上——让原始指令始终在视野内、 察觉工具调用已经悄悄失败、区分"完成了"和"没辙了"。这些没有一条会在聊天演示里露面。
系统卡的早期草稿曾报告:拒绝基准较上一代提升 9 个百分点。那个数字是错的。 评测切分被训练数据污染,模型被测的并不是卡片声称在测的东西。
评测套件已用留出切分与持续污染检查重建;受影响的结论已从卡片中撤回,而非悄悄改写。 重建后的基准显示的改进小于原数字——这才是我们现在报告的数。
发布门槛现覆盖工具滥用与多天任务中的指令漂移,外加网络提升、生物风险与压力下拒绝行为的常设套件。 结果都在系统卡里——包括两款模型没有超越前代的那几项。
| 属性 | Cortex 5.1 | Pulse 5.1 |
|---|---|---|
| 上下文窗口 | 1M tokens | 1M tokens |
| 定位 | 长程智能体、含糊简报、分析 | 生产流量、编码、客服、抽取 |
| 延迟性格 | 从容 | 跟手 |
| 相对成本 | $$$$ | $$ |
| 可用性 | Pro、团队、企业、API | 免费、Pro、团队、企业、API |