post cover

AI 热点快报:Claude Sonnet 5.5 默认开启「安全回退」——你调用的模型可能不是你指定的那个(2026-09-29)


事件与背景

2026 年 9 月 28 日,Anthropic 发布 Claude 5.5 家族第二个模型 Claude Sonnet 5.5。官方口径:输出速度比 Sonnet 5 快 30% 以上,单任务成本最多低 30%,API 定价维持 $2 / 百万输入 token、$10 / 百万输出 token、缓存读取 $0.20 / 百万 token。在最受关注的 agentic coding 评测 Terminal-Bench 4.0 上,Sonnet 5.5 得 70.6%,Sonnet 5 只有 10.3%,上一代旗舰 Opus 5.5 是 66.4%。

然后是真正该让工程师停下来看的那一半:同一天生效的还有一套默认开启的安全回退(fallback)机制。

  • Sonnet 5.5 是第一个带 cyber fallback 的 Sonnet 模型。安全分类器在每个请求上运行,命中高风险网络安全请求(漏洞利用生成、二进制漏洞扫描、渗透测试)时,请求回退到 Claude Sonnet 5 而不是被拒绝。
  • 分类器检查的不只是你输入的那条消息。官方帮助文档写明:检查范围包括 memory、连接器内容、web search 结果和文件,因此回退可能由你没有亲手输入的内容触发。
  • 自动模型切换默认开启。回退发生时,请求在同一会话里由 Sonnet 5 重新执行,模型选择器此后停留在 Sonnet 5,回复会标注实际作答的模型。
  • 不同类别行为不同:生物学相关请求直接拒绝、不回退;蒸馏类(要求模型原样复述推理链)直接拒绝;前沿 LLM 开发相关(例如某些 ML 加速器上的 kernel 开发)回退到 Sonnet 5。
  • 可以关闭:Settings > Capabilities,Claude Code 里是 Config > MODEL & OUTPUT 的「Switch models when a message is flagged」。关闭后,被命中的请求会暂停会话,而不是静默换模型。
  • 发布层面:Sonnet 5.5 在 AWS、Google Cloud、Microsoft Azure 上同步提供,支持零数据保留(ZDR),模型标识为 claude-sonnet-5-5;Haiku 5.5 将在未来数周加入同一家族。

Anthropic 对两个模型的定位也值得记一笔:Opus 5.5 面向需要持续判断的复杂开放式工作,Sonnet 5.5 面向「范围明确」的任务——修 bug、做文档/幻灯片/表格。这个界线决定了你该把哪一类子任务放进 Sonnet 5.5,也决定了回退发生时损失最大的是哪一类任务。

已验证来源(均以 curl 返回 200 并核对正文):

为什么现在重要

1. 模型身份从「部署时决定」变成「运行时变量」。 过去「我们用的是 Sonnet 5.5」是一句架构事实;现在它是一句概率陈述——大部分请求是,少数不是。影响:任何以模型版本为前提的假设(提示词调优、上下文长度、工具调用格式、成本预算)都需要一个运行时校验点,而不是写在设计文档里就算数。

2. 回退的代价是断崖式的,不是渐变。 回退目标是 Sonnet 5,它在 Terminal-Bench 4.0 上是 10.3%,而 Sonnet 5.5 是 70.6%——同一个 agent 会话里,子任务可能从「能完成」掉到「基本完不成」,而且用户看到的只是一行提示。影响:agent 产品需要在回退发生后给出明确的降级信号,而不是把两个模型的结果混在同一条任务链里交付。

3. 触发面大于你的提示词。 分类器同时读 memory、连接器内容、搜索结果和文件,这意味着你无法通过「别写敏感提示词」来控制它。影响:回归测试必须带生产级上下文(真实抓取的网页、真实检索到的文档),否则线上才会第一次遇见回退。

4. 基准分数本身已经被回退污染,看榜选型要更谨慎。 System Card §8.5 披露:Sonnet 5.5 的 70.6% 是在开启防护下测的,被标记的请求占 1.2%、影响 1.5% 的 trial,由回退模型作答;Opus 5.5 的 66.4% 则有 2.5% 请求被标记、影响 10% 的 trial。同一张表里,Sonnet 5.5 在 Max effort 下的 FrontierCode 分数(46.2%)反而低于 Xhigh(52.1%),官方解释是 Max 更常触发代码审查子 agent,导致超时或越界修改被扣分。影响:官方 benchmark 的「谁更强」结论仍然是可用的,但用它做 30% 级别的采购决策前,必须自己复现一次并记录回退率。

5. 合规与计费规则跟着一起变。 帮助文档写明:在模型开始输出之前就被拦下的请求,若属于生物学、蒸馏或 LLM 开发类别会照常计费,其他类别的拦截不计费;Sonnet 5.5 上线时不在 Cyber Verification Program 覆盖范围内,ZDR(零数据保留)组织目前也不符合 CVP 申请条件。影响:安全团队与采购团队需要在合同和成本模型里区分「被拒绝」「被回退」「正常完成」三种结局。

6. 定价的旋钮已经从「模型档位」移到「effort 档位」。 官方给出的对比口径是:Sonnet 5.5 在 Low / Medium effort 下以约十分之一的单任务成本超过 Sonnet 5 的最好成绩,而到了 High / Xhigh / Max,它与 Opus 5.5 的能力和成本都趋于接近。影响:与其问「用 Sonnet 还是 Opus」,更实际的问法是「这个任务需要哪一档 thinking effort」,这直接决定了成本曲线和回退风险的大小。

工程师/产品人今天能做什么

  1. 给每次模型调用记录真实作答方。 把响应里的模型标识、是否发生回退、effort 级别写进日志和 trace,并对「期望模型 ≠ 实际模型」的样本打告警;这是所有后续判断的数据基础。
  2. 用生产级上下文跑一次回退敏感性回归。 取 20–50 条真实线上任务(包含抓取网页、检索片段、长 memory),开启防护跑一遍,统计回退率与回退后的任务成功率;把结果写成一张表,作为是否采用 Sonnet 5.5 的依据。
  3. 按场景决定自动切换的开关。 内部草稿、文档、前端迭代类任务可以保留默认自动切换以减少中断;有审计要求、安全工具链或交付质量的流水线应关闭切换,并为「会话暂停」补上超时、重试与人工接管的路径——否则 agent 会卡死而不是失败。
  4. 重算单位任务成本,而不是单位 token 成本。 定价没变($2/$10),但每个任务消耗的 token 少了;用你自己的 token/任务统计跑一遍,再决定是否把 Opus 的高 effort 档位降级到 Sonnet 5.5 的低/中档。
  5. 走一遍资质申请与迁移清单。 做漏洞扫描、渗透测试类工具的团队去确认 CVP 覆盖面与 ZDR 冲突;生命科学相关团队看 LSVP;从 Sonnet 5 迁移时注意:若你在关闭 thinking 的状态下运行,需要先切到新的 between_tools 设置,另外「保留思考(preserved thinking)」扩展到思考无法与原账号解绑,跨账号搬会话(包括 Claude Code 中途换账号)的行为要单独验证。

待观察

  • API 层是否返回机器可读的回退标记。 帮助文档描述的是第一方产品界面上的提示;System Card 说自动回退在 API 上需要开发者主动 opt-in。API 响应里到底有没有可判定的字段,我们尚未验证,这决定了第 1 条动作能否做到全自动。
  • Cyber Verification Program 何时覆盖 Sonnet 5.5,以及 ZDR 组织届时是否有申请路径。
  • Haiku 5.5 的发布时间(官方称「未来数周」),以及它是否会沿用同一套回退策略——如果会,价格敏感的高并发场景也会继承同样的运行时不确定性。