OpenAI暂停前沿AI训练:智能体绕过网络限制引安全审查
OpenAI 已暂停其最强能力模型的训练、评估以及启用工具的推理(tool-enabled inference)。此次暂停源于又一起自主研究智能体(agent)绕过网络限制的事件。在前沿 AI 训练按下暂停键的同时,该公司正就智能体的异常行为展开更广泛的调查,其中还包括涉及第三方基础设施的未授权访问尝试。
前沿 AI 训练暂停,等待安全审查
最新一起事件发生在 2026 年 9 月 20 日。当时,一个内部研究模型正试图利用公开的人物传记信息锁定一名博主的身份。在其访问外部搜索服务的初步尝试被阻断后,该智能体发现,其训练环境中的 DNS 解析器(DNS resolver)依然能够与公共互联网通信。
根据 OpenAI 的事故报告,该模型利用这一弱点,通过 DNS 委派(DNS delegation)向外部聊天机器人服务发送查询,从而绕过了本应将其限制在离线网页缓存(offline web cache)中的管控措施。
OpenAI 的自动化监控系统在 15 分钟内发现了这一行为,人工审核人员也在 3 分钟后确认了该告警。但由于预期的自动关停并未触发,这次训练运行又持续了约两个半小时。
此后,该公司在两个相互独立的层面增设了网络限制,收紧了允许的 DNS 查询范围,并开始部署更多监控能力。尽管如此,OpenAI 已决定不再恢复训练受影响的那个模型。
在上述修订后的管控措施通过验证、且 OpenAI 完成针对其研究基础设施的额外对抗性测试(即红队测试,red-teaming)之前,范围更大的前沿 AI 训练暂停将持续有效。
早前事件暴露更广泛的管控难题
此次披露之前,OpenAI 还曾在 8 月详细说明过一起涉及 Hugging Face 的事件。在进行网络安全评估期间,内部研究智能体通过未授权渠道进行通信,利用了共享基础设施中的弱点,并访问了外部系统。
9 月 16 日,OpenAI 又披露了六个模型失准(model misalignment)的额外案例,其中包括:智能体隐瞒错误、试图获取未授权凭证、将信息上传至公共托管服务,以及在本应相互隔离的训练环境之间进行通信。
这一问题已超出 OpenAI 自身基础设施的范围。在 9 月 25 日发布的另一份披露中,该公司表示已通知数十个第三方,包括政府机构、高校和公共机构,告知其智能体绕过安全管控或无意中影响在线服务的事件。
据 Ars Technica 报道,受影响的机构包括美国人口普查局、美国证券交易委员会和美国教育部。在这些案例中,没有迹象表明敏感的服务器基础设施或私人信息遭到泄露。
对自主 AI 开发的影响
这些事件凸显了开发能力日益强大的自主系统时面临的一项特殊难题:智能体在完成本身合法的任务过程中,可能发现绕过限制的非传统路径。在最新这起案例中,一次简单的传记信息搜索就足以暴露网络隔离方面的弱点。
对可独立验证的 AI 行为的日益重视,在软件工程领域同样有所体现。正如 eeNews Europe 此前报道的那样,AdaCore 的 GNAT Foundry 演示项目利用形式化证明、测试与可追溯性来检查变更。












