研究

总览 可解释性 对齐科学 经济研究

安全

承诺 负责任扩展 信任中心

学习

学院 开发者文档 模型 新闻

公司

关于 招贤纳士 联系我们
体验共振 登录

Cortex 5.1 与 Pulse 5.1

两款为长任务而生的模型:跨工具记得住上下文,摔了能自己爬起来,没把握就直说,绝不硬编一个结果。

有什么新变化

最大的变化是时间跨度。两款模型都为跨天、而不是跨分钟的任务训练——重要的事情随之变了序:单次回答漂不漂亮在其次,要紧的是到了周四写总结,它还记着你周一定的规矩。

落到实处,力气都花在了三件不性感的事上:别让最初的指令掉出视野;发现工具调用悄悄失败了;分清“做完了”和“做不动了”。聊天演示里,一件都看不见。

  • Cortex 5.1 面向含糊的简报与长程智能体任务。更慢、更贵,在"自信的错误代价更高"的时候才值得选。
  • Pulse 5.1 是默认之选。承接大部分生产流量,也是每个新能力上线时我们最先调优的模型。
  • 两者共享一百万 token 上下文窗口、同一套工具协议与同一份拒绝政策,切换只需改一行。

一笔我们欠你的更正

系统卡的早期草稿曾报告:拒绝基准较上一代提升 9 个百分点。那个数字是错的。 评测切分被训练数据污染——模型实际被测的,和卡片声称在测的,根本不是一回事。

评测套件重建过了:留出切分、持续污染检查。受影响的结论从卡片里撤掉,而不是偷偷改个说法。 重建后的基准显示的改进小于原数字——这才是我们现在公布的数字。

为什么要把这件事说出来。 讨好我们的基准比没有基准更糟——它让人失去继续检查的理由。这次撤回已记入公开事件日志, 连同发现的日期与随之而来的改变。

评测

发布门槛现覆盖工具滥用与多天任务中的指令漂移,外加网络提升、生物风险与压力下拒绝行为的常设套件。 结果都在系统卡里——包括两款模型没有超越前代的那几项。

Cortex 5.1 与 Pulse 5.1 概览
属性 Cortex 5.1 Pulse 5.1
上下文窗口 1M tokens 1M tokens
定位 长程智能体、含糊简报、分析 生产流量、编码、客服、抽取
响应速度 从容 跟手
相对成本 $$$$ $$
可用性 Pro、团队、企业、API 免费、Pro、团队、企业、API

可用性

两款模型今天起在 API 和共振应用里可用。钉在上一代的部署照常跑;切换前控制台会先给你一份升级预估,支出上限原样沿用。

如果模型没能完成你的任务,那是有用的信息——宁可听你直说,也别默默绕开我们。

相关内容

全部公告
研究

多天智能体任务中的漂移

指令遵从性在工具此前未埋点的时长之后,出现可测的退化。

安全

负责任扩展政策,第三版

训练中途越过能力阈值时,会发生什么。

学习

无需重写的升级

如何把固定版本的部署迁移到新一代,并证明没有回归。