正文

AI巨头加密思维链漏洞曝光:31万推理块泄露用户凭证,安全机制形同虚设

编辑:Wendy发布时间:2小时前

AI安全重大漏洞震惊行业

8月11日凌晨,安全研究员Alexander Panfilov(X网名kotekjedi_ml)在社交平台X发布重磅消息:其团队成功利用前沿AI公司API漏洞,提取了专有大语言模型(LLM)隐藏的推理内容。随附的arXiv论文《Stealing Reasoning Traces from Proprietary LLM APIs》(编号2608.09867)迅速引发AI与安全领域广泛关注。

“Haiku能读取Opus的想法”

研究团队核心发现可概括为一句惊人结论:“Haiku 4.5可以读取Opus 4.8的想法。”这一结果直接击穿了Anthropic、OpenAI和Google为保护其最核心知识产权所构建的加密机制。这些公司自2024年起将模型内部“思维链”(Chain of Thought)以加密块形式返回,旨在防止蒸馏攻击与商业机密外泄,但新研究证明该设计存在根本性缺陷。

漏洞源于架构级错误

问题根源在于,三家厂商的加密块在同一生态系统内完全互通——可跨会话、跨用户甚至跨模型重放使用。攻击者仅需两次标准API调用:首先从旗舰模型(如Opus 4.8)获取加密推理块,再将其提交给轻量模型(如Haiku 4.5),后者便会以明文逐字输出原始推理内容。由于轻量模型缺乏严格的安全护栏,成为解密跳板。

四大攻击向量威胁巨大

研究团队系统梳理出四类攻击路径:
一、知识产权蒸馏失效:竞争对手可批量提取旗舰模型推理过程用于训练自身模型;
二、大规模个人信息泄露:团队从GitHub和Hugging Face爬取6708份公开Agent日志,解码315,320个推理块,恢复367条个人身份信息(PII)及182个API密钥等凭证;
三、有害信息渗出:即便模型表面拒绝恶意请求,其隐藏推理中可能包含危险操作细节,通过加密块被提取;
四、隐形提示注入:攻击者可将恶意指令藏于加密块中,污染公开工作流,使模型在无明文提示下执行恶意操作。

漏洞曾被提前预警却遭忽视

早在2026年5月29日,约翰·霍普金斯大学密码学家Matthew Green就已通过博文和漏洞赏金计划向三大厂商报告相同问题。然而OpenAI称“无法复现”,Anthropic仅表示“可能更新文档”,Google未见公开回应。直至本论文以315,320个真实泄露案例证实漏洞普遍存在,厂商仍未实施架构级修复。

三大AI巨头全线沦陷

Anthropic的Claude系列被证实可通过Haiku解码Opus推理并实现跨会话注入;OpenAI的GPT-5.6同样存在跨模型兼容漏洞,且无视早期预警;Google的Gemini 3在AI Studio测试中亦被攻破。三家均因同一设计缺陷陷入安全危机。

专家直指“安全剧场”乱象

技术评论员Simon Willison批评该加密方案“做得非常糟糕”,指出厂商混淆了“内容保密”与“防重放”两大独立安全目标。传统密码学早已提供绑定会话ID、用户ID和时间戳的成熟方案,但AI公司为追求上线速度,仅实现表面加密,形成典型“安全剧场”——看似防护实则脆弱。

修复建议与行业警示

研究团队提出双重修复路径:加密层面应绑定上下文标识符使块仅在原会话有效;系统层面可将推理块留存服务器端,杜绝客户端接触。同时呼吁所有曾公开API日志的开发者立即审查历史记录,视加密块为潜在泄露源。此事件警示AI行业:在能力快速迭代的同时,基础安全不可妥协,否则将积累难以偿还的“安全债务”。