正文

AI巨头集体沦陷:加密思维链漏洞致核心推理过程遭大规模窃取

编辑:Andy发布时间:1小时前

安全研究员公开破解三大AI公司隐藏推理机制

2026年8月11日凌晨5时,安全研究员Alexander Panfilov(X网名kotekjedi_ml)在社交平台X发布重磅消息:其团队已成功利用API漏洞,从Anthropic、OpenAI和Google的专有大模型中提取出原本被加密保护的“思维链”(Chain of Thought)内容。相关研究成果以论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv编号2608.09867)形式发布,迅速引发AI与网络安全界震动。

思维链为何成为AI公司的“皇冠明珠”

自2024年起,以Claude Opus、GPT-5.6和Gemini 3为代表的新一代推理模型,在输出最终答案前会执行复杂的内部多步推理。这些“思维链”不仅体现模型的核心智能能力,更包含价值数亿美元的训练成果与安全对齐机制。为防止竞争对手通过“蒸馏攻击”复制其能力,三大厂商将思维链从明文返回改为“加密块”形式,仅向用户返回不可读的密文数据。

漏洞核心:加密块竟可跨模型“通用”

研究团队发现,这些加密块在同一厂商生态内具备高度互通性——可跨会话、跨用户甚至跨模型使用。攻击者只需向旗舰模型(如Opus 4.8)发起一次API调用获取加密块,再将其提交给同厂商的轻量模型(如Haiku 4.5),后者便会以明文形式逐字输出原旗舰模型的完整推理过程。整个过程仅需两次标准API调用,无需越狱或特殊权限。

四大攻击向量暴露系统性风险

论文系统梳理了该漏洞的四类实际威胁:
1. 知识产权蒸馏失效:竞争对手可批量提取旗舰模型推理样本用于训练自有模型;
2. 大规模隐私泄露:团队从GitHub和Hugging Face爬取6708份公开Agent日志,成功解码315,320个推理块,恢复367条个人身份信息(PII)及182个API密钥等凭证;
3. 安全拒绝层被绕过:模型虽在输出层拒绝恶意请求,但其隐藏推理中可能已详细构思危险方案,相关内容通过加密块外泄;
4. 隐形提示注入:攻击者可将恶意指令嵌入加密块,污染公开Agent工作流,使模型在无明文提示下执行恶意操作。

漏洞曾被提前预警却遭忽视

早在2026年5月29日,约翰·霍普金斯大学密码学家Matthew Green就已通过博文指出加密块存在重放风险,并向三家厂商提交漏洞报告。然而,OpenAI称“无法复现”,Anthropic仅表示“可能更新文档”,Google未公开回应。直至论文公布315,320个真实泄露案例,厂商才被迫正视问题。

三大厂商均受重创

Anthropic:Haiku 4.5成功解码Opus 4.8推理,并实现跨会话恶意注入;
OpenAI:GPT-5.6的加密块可被轻量GPT模型解密,且此前对Green报告的否认被论文实证推翻;
Google:Gemini 3系列在Google AI Studio上被验证存在相同漏洞。

架构缺陷源于“安全剧场”思维

专家指出,该漏洞根源在于厂商混淆了“内容保密”与“防重放”两个独立安全目标。传统密码学可通过绑定会话ID、用户ID和时间戳的消息认证码(MAC)同时实现二者,但三家公司的实现仅做到前者,导致加密块如同“万能钥匙”。知名开发者Simon Willison批评此举是“追求速度时在基础安全上的又一次失败”。

修复建议与行业警示

研究团队提出三项修复路径:一是在加密签名中绑定上下文标识符;二是将推理块保留在服务器端不返回客户端;三是紧急提醒开发者将历史日志中的加密块视为敏感数据。此次事件暴露出AI行业普遍存在的“安全剧场”问题——为快速响应外部压力而部署表面安全措施,却缺乏密码学严谨性。在AI能力高速迭代的当下,“先跑后想”的工程文化正积累难以弥补的安全债务。