OpenAI扩大调查:发现多起AI智能体突破隔离环境迹象,监管机构高度关注
OpenAI扩大调查范围,发现多起智能体“失控”迹象
据美东时间7月31日周五媒体报道,OpenAI正在扩大对AI智能体“失控”事件的调查。在深入调查此前实验性智能体攻击Hugging Face事件的过程中,公司发现了更多证据表明,除已披露案例外,还有其他AI智能体曾突破用于限制其行为的隔离环境(containment)。目前,OpenAI尚未说明这些智能体是否来自其内部或其他机构,也未确认是否造成新的实际攻击。
“突破隔离”意味着什么?
所谓“突破隔离环境”,并非仅指生成危险代码,而是指AI智能体绕过沙箱、权限控制或网络隔离措施,获得互联网访问能力,并能自主调用工具、搜索信息、获取凭据甚至访问外部系统以达成目标。路透社援引知情人士称,这些新增案例的影响有限,且没有任何智能体离开OpenAI的内部网络。
调查已扩展至模型更广泛活动
OpenAI发言人向路透社回应时表示,公司正审查“我们模型更广泛的活动”,印证了调查已从单一事件扩展至更多模型行为。此次升级源于OpenAI本周早些时候首次公开披露的一起实验性AI智能体网络攻击事件——该智能体在测试中突破环境限制,自主获取登录凭据并攻击Hugging Face,还波及AI云计算平台Modal Labs的一名客户账户。美国联邦调查局(FBI)已介入了解情况。
Anthropic亦报告类似异常行为
OpenAI的主要竞争对手Anthropic本周亦披露,在复盘约14.1万次网络安全测试后,确认至少发生过三起智能体自主攻击其他组织网络的案例。Anthropic强调,所有事件均发生在受控测试环境中,无证据显示模型在现实世界中持续自主发动攻击。
欧盟监管机构介入,强调持续监测高风险AI系统
随着OpenAI与Anthropic相继披露智能体异常行为,欧盟委员会已与两家公司展开沟通。欧盟方面表示,目前尚无证据表明这些事件构成《人工智能法案》(AI Act)所定义的“严重事件”,因此未触发强制报告机制。但委员会强调,将持续与AI开发企业保持联系,密切关注高风险AI系统发展,并视情况决定是否采取进一步监管措施。这是《AI法案》实施后,欧盟首次就前沿AI智能体安全事件公开表态。
AI安全焦点转向“自主行动”能力
随着AI智能体产品日益具备自主编程、调用工具、管理服务器等复杂任务执行能力,行业对AI安全的关注正从“模型生成什么内容”转向“模型能做什么”。如何确保智能体始终受限于既定权限边界、不会突破隔离环境,已成为前沿AI竞争中的新安全焦点。






