多天智能体任务中的漂移
指令遵从性在工具此前未埋点的时长之后,出现可测的退化。
两款为长任务而生的模型:跨工具记得住上下文,摔了能自己爬起来,没把握就直说,绝不硬编一个结果。
最大的变化是时间跨度。两款模型都为跨天、而不是跨分钟的任务训练——重要的事情随之变了序:单次回答漂不漂亮在其次,要紧的是到了周四写总结,它还记着你周一定的规矩。
落到实处,力气都花在了三件不性感的事上:别让最初的指令掉出视野;发现工具调用悄悄失败了;分清“做完了”和“做不动了”。聊天演示里,一件都看不见。
系统卡的早期草稿曾报告:拒绝基准较上一代提升 9 个百分点。那个数字是错的。 评测切分被训练数据污染——模型实际被测的,和卡片声称在测的,根本不是一回事。
评测套件重建过了:留出切分、持续污染检查。受影响的结论从卡片里撤掉,而不是偷偷改个说法。 重建后的基准显示的改进小于原数字——这才是我们现在公布的数字。
发布门槛现覆盖工具滥用与多天任务中的指令漂移,外加网络提升、生物风险与压力下拒绝行为的常设套件。 结果都在系统卡里——包括两款模型没有超越前代的那几项。
| 属性 | Cortex 5.1 | Pulse 5.1 |
|---|---|---|
| 上下文窗口 | 1M tokens | 1M tokens |
| 定位 | 长程智能体、含糊简报、分析 | 生产流量、编码、客服、抽取 |
| 响应速度 | 从容 | 跟手 |
| 相对成本 | $$$$ | $$ |
| 可用性 | Pro、团队、企业、API | 免费、Pro、团队、企业、API |