AI 热点快报:加密思维链可被跨模型重放破解,OpenAI/Anthropic/Google 隐藏推理全线失守(2026-08-12)
事件与背景
8 月 11 日,一组来自 ELLIS Tübingen / Max Planck / MATS 的研究者(Alexander Panfilov、Maksym Andriushchenko 等)发布论文 《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv 2608.09867,项目主页 stolen-thoughts.com),登顶 HackerNews(HN 讨论,559 分)。
核心发现:OpenAI、Anthropic、Google 为了保护模型思维链(chain-of-thought, CoT),把推理过程加密成块返回给客户端,由客户端在后续请求中回传。但这些加密块在会话、用户、模型之间完全可互换重放——研究者把前沿模型(如 claude-opus-4-8)的加密轨迹注入同一厂商防护更弱的兄弟模型(如 claude-haiku-4-5),再对弱模型做 jailbreak 要求逐字转写,就能明文还原强模型的完整隐藏推理,全程无需攻击强模型本身,也不会触发其防蒸馏机制。The Decoder 报道称,多数查询下提取出的 token 数与 API 计费的 thinking token 数完全吻合,证明拿到的是真实推理(The Decoder 报道)。
论文披露四条攻击路径:① 绕过防蒸馏,在 Anthropic/OpenAI/Google 三家均验证可行;② 大规模隐私数据提取——从 GitHub/Hugging Face 公开仓库收集 6,708 条 agent 轨迹,解码出 315,320 个推理块,恢复 704 个隐私产物(62 个 API key、33 个密码、24 个访问令牌、30 个邮箱),其中 64 个只出现在推理块里、可见会话中完全没有;③ 即使模型最终输出安全地拒绝了恶意请求,隐藏推理里仍可能包含危险信息;④ 攻击者可在加密块中嵌入隐形提示注入,污染公开的 agent 工作流。负责任披露后,厂商仅确认收到报告、未承认安全影响,且研究者已无法复现攻击。
同一窗口的对照信号:Anthropic 宣布对全部 Claude 输出嵌入模型级隐形水印(The Decoder 报道,Daring Fireball 摘录官方说明),水印随文本复制粘贴传播、可经受部分编辑,检测工具后续开放。
为什么现在重要
1. 行业「用加密隐藏推理」的整个架构被证明是伪安全。 加密块必须可被服务端解密、可跨模型重放才能支撑「会话中切换模型」的产品功能,而这个设计恰好就是漏洞本身。影响判断:各家「隐藏 CoT 即护城河」的叙事失效,未来 1-2 周内 OpenAI/Anthropic/Google 必然收紧密钥管理与重放策略,模型切换体验可能随之改变。
2. 你的密钥可能躺在别人能解码的公开日志里。 62 个 API key、33 个密码从公开仓库里被挖出来,且 64 个隐私产物只存在于推理块中、常规日志审计根本看不到。影响判断:所有把 agent 会话导出、分享、或上传到可公开位置的团队,都面临实际泄露风险;「可见输出里没有敏感信息」不再等于安全。
3. 防蒸馏机制的信任根基被击穿。 此前各家把「加密 CoT + 拒绝明文输出」当作对抗蒸馏(如 Anthropic 指控阿里蒸馏事件)的技术防线,现在弱模型转写路径绕过了全部防线。影响判断:蒸馏攻防的主动权转移到攻击方,闭源模型厂商的 IP 保护叙事需要重构,开源模型的相对竞争力进一步上升。
4. Agent 生态出现新的投毒面:加密块本身成为攻击通道。 提示注入不再需要出现在可见文本里,可以藏在加密推理块中随轨迹传播、污染下游 agent。影响判断:做 agent 产品、共享轨迹数据的团队,威胁模型里必须新增「加密块内容不可信」这一条。
5. 厂商响应模式暴露行业惯例:收到报告、不承认影响、静默修复。 三家都未承认安全影响,但研究者已无法复现——典型的「闷声补丁」路径。同日 Anthropic 上水印,说明行业重心正从「隐藏推理」转向「标记输出」。影响判断:推理可解释性与内容溯源,正在取代保密,成为新一轮产品差异化维度。
工程师/产品人今天能做什么
- 立即审计公开的会话/轨迹:grep 你的仓库与分享过的 agent 日志里是否含
"thinking"+"signature"字段的加密块;有则轮换其中可能暴露的 API key 与令牌(尤其是 GitHub/Hugging Face 上公开过的)。 - 更新威胁模型:把加密推理块当作明文等价物对待——不要假设「厂商加密了所以安全」,传输、存储、日志脱敏都要按敏感数据处理。
- 为 agent 产品加一道过滤:对回传的 thinking 块做校验,发现被注入转写指令(如
<thinking-copy>类模式)时告警;不盲目把上游轨迹拼进上下文。 - 跟进厂商修复:未来数周观察各家是否改为「按会话/按模型独立密钥 + 绑定会话 ID」,并回归测试「会话中途切换模型」功能是否受影响。
- 重新评估蒸馏风险:如果你依赖 API 蒸馏、或担心竞对从你的 API 蒸馏,按「弱模型转写路径存在」更新风险台账;对依赖「推理不可见」的安全设计做替代方案。
待观察
- 修复方案落地细节:三家会采用按会话密钥、按模型绑定,还是直接禁止跨模型重放?模型切换 UX 会因此退化多少。
- Anthropic 水印的检测工具与对抗强度:官方承诺的检测机制何时开放,「可经受部分编辑」的边界在哪,其他厂商是否跟进。
- 后续攻击变体:trace inversion(从输出反推合理推理,arXiv 2603.07267)与「每发一个前沿模型就把新轨迹灌进同厂弱模型」的组合,是否会成为常态化的蒸馏新管道。
声明:本文所有来源 URL(arXiv、stolen-thoughts.com、The Decoder、Daring Fireball、HN)均经 curl 验证返回 200;HN 讨论页在读者浏览器可正常访问。