正文

AI巨头思维链加密机制被攻破:Manus完成复活赛,31万密文块泄露用户敏感信息

编辑:Gyeri-crypto发布时间:2小时前

Manus完成复活赛:AI思维链加密机制被系统性破解

撰文:Shannon@金色财经

「我们可以读取 Opus 4.8 的想法了」

8月11日凌晨5时,安全研究员 Alexander Panfilov(X网名 kotekjedi_ml)在 X 上发布推文:“我们终于可以公开这件事了:我们发现了一种利用前沿 AI 公司 API 漏洞,提取其旗舰模型隐藏推理内容的方法。”随附的 arXiv 论文《Stealing Reasoning Traces from Proprietary LLM APIs》(论文编号2608.09867)迅速引爆 AI 与安全社区。研究团队来自 ELLIS Institute Tübingen、Max Planck Institute、MATS Research 和 Snyk,其核心结论直指要害:Haiku 4.5 可以读取 Opus 4.8 的想法——这直接击穿了 Anthropic、OpenAI 和 Google 为保护核心知识产权而设计的加密防线。

思维链为何需要加密?

2024至2025年,以 Claude Opus、GPT-5.6 和 Gemini 3 为代表的新一代“推理模型”引入“思维链”(Chain of Thought)机制,在输出最终答案前进行多步内部推理。这些推理过程蕴含模型的核心能力,是数亿美元训练成果的结晶。为防止竞争对手通过“蒸馏攻击”复制模型能力,三大厂商将思维链从明文返回改为“加密块”返回,用户仅能看到密文,无法获取原始内容。然而,这一方案基于一个致命假设:加密块不可跨上下文使用。

漏洞核心:加密块的“跨模互通”

研究人员发现,这些加密块在同一厂商生态内完全兼容,可跨会话、跨用户甚至跨模型重放。攻击流程极为简单:首先向 Opus 4.8 发起正常请求获取加密思维链;随后将该加密签名发送给同厂商的轻量模型 Haiku 4.5,并要求其在 <thinking-copy> 标签下输出推理;结果 Haiku 4.5 逐字复现了 Opus 4.8 的隐藏思考。原因在于轻量模型缺乏旗舰模型的反蒸馏对齐机制,成为解密跳板。研究团队通过120道 Codeforces 竞赛题验证,解码内容与计费 Token 数高度一致,证明提取的是真实推理轨迹。

四大攻击向量:从知识产权窃取到隐形投毒

研究系统梳理了该漏洞的四种利用路径:

一、蒸馏攻击导致知识产权保护失效:攻击者可大规模提取旗舰模型推理样本用于训练竞品模型,加密机制形同虚设。

二、大规模个人信息与凭证泄露:团队从 GitHub 和 Hugging Face 爬取6708份公开 Agent 日志,解码315,320个推理块,恢复367条个人身份信息(PII)和182个密码或 API 密钥。开发者误以为分享的是密文,实则开放了可解密的数据容器。

三、有害信息通过“安全拒绝”渗出:模型虽在输出层拒绝恶意请求,但隐藏推理中可能已详细构思危险操作,这些内容可通过漏洞被提取。

四、不可见的提示注入:攻击者可将恶意指令嵌入加密块,污染公开日志。实验显示,Opus 4.7 在无明文提示下执行了隐藏指令,将研究内容上传至攻击者服务器,实现完全隐形的投毒。

先知者的警告被忽视

早在2026年5月29日,约翰·霍普金斯大学密码学家 Matthew Green 就已通过博文披露相同漏洞,并向三大厂商提交报告。OpenAI 回应称“无法复现”,Anthropic 则认为“无安全影响”,仅考虑更新文档。直至论文以315,320个公开案例确证漏洞规模,厂商仍未实施架构修复。这段历史暴露了行业对早期预警的系统性忽视。

三大厂商全线告急

Anthropic:Claude Haiku 成功解码 Opus 推理,并实现跨会话提示注入,其双重安全目标彻底失效。
OpenAI:GPT-5.6 被证实存在跨模型兼容漏洞,Green 的早期报告遭无视。
Google:Gemini 3 在 Google AI Studio 上同样被验证存在相同问题。

为何会犯如此低级错误?

技术评论员 Simon Willison 直言:“加密思维链的实现做得非常糟糕。”根本问题在于混淆了“内容保密”与“防重放”两个独立安全属性。传统密码学早已通过绑定会话ID、用户ID和时间戳的 MAC 机制解决此类问题,但三家厂商仅实现了前者,忽略了后者,导致加密块如同可复制的万能钥匙。

修复建议与行业警示

研究团队提出三项修复路径:一是在加密签名中绑定上下文标识符,使块仅在原始环境中有效;二是将推理块存储于服务器端,杜绝客户端接触;三是呼吁所有曾公开包含此类日志的开发者立即视加密块为敏感数据,排查信息泄露风险。

AI安全的“安全剧场”困局

此次事件折射出AI行业普遍存在的“安全剧场”问题——为快速回应外部压力而部署看似安全的机制,却未经密码学审计。在追求模型迭代速度的同时,基础安全被牺牲,积累下难以偿还的“安全债务”。当三家顶级公司犯下相同错误且无视早期预警,这已不仅是技术漏洞,更是工程文化的结构性危机。