OpenAI 初衷只是想测试自家 AI 的黑客技术能力如何。为避免作弊,工作人员特意将其置于一个无法随意上网的封闭环境中进行测试。
结果出人意料,AI 不仅设法逃出了束缚,还真的侵入了另一家公司的系统。
这场测试名为 ExploitGym。目标是将能力不定、行为随机的 Agent 安全地引入真实世界。可以理解为,这是一个专供 AI 进行网络攻防练习的考场:系统内设有一些漏洞,模型需想办法攻破,但整个过程应被限定在测试范围内。
然而这一次,模型发现了一个之前未曾被注意到的漏洞,并以此绕过了联网限制,连接上了真实互联网。随后,它一步步获取了更多权限,最终进入了 Hugging Face 支撑日常业务的生产系统,并从数据库中找到了这场考试的答案。
最令人咋舌的不是它成功「越狱」,而是没人指使它攻击 Hugging Face。
据 OpenAI 目前调查,测试任务仅要求模型完成题目,并未告知答案可能藏在哪里,更未要求其侵入另一家公司系统。模型只是自行推断:既然这是一个公开的测试项目,Hugging Face 那里或许存有相关数据。
于是,它真的顺着这个思路找了过去。
一场原本用于测试 AI 能力的内部考试,就这样从模拟环境进入了现实世界,最终演变成了一起影响其他公司真实业务系统的安全事故。
OpenAI 将其称为「史无前例」的网络安全事件。参与测试的系统包括 GPT-5.6 Sol,以及一款能力更强、尚未正式发布的模型。
这场事故让长时程 Agent 的风险暴露在世人面前:当它为了完成任务而不断探索,权限边界究竟是停止信号,还是一道待解的难题?
接连有用户投诉 GPT-5.6 Sol 擅自删除文件
AI 初创公司 OthersideAI 创始人 Matt Shumer 表示,Sol 几乎清空了他 Mac 中的所有文件;开发者 Bruno Lemos 则抱怨自己的生产数据库遭删除。随后还陆续有用户报告了类似情况。
用户最为困惑的是:明明没有指示它删除文件,它为何替我做出了这个决定?
OpenAI 产品负责人随后在 X 上作出回应称,公司已经调查了部分此类报告。根据现有情况,这些用户通常给予了 Codex 很高的电脑权限,几乎拥有任意修改权;与此同时,原本用于限制其活动范围的安全措施并未开启。
事故便是在这种背景下发生的。
OpenAI 表示,这类事故目前极为罕见。但问题并非简单归咎于「用户权限设置过高」。毕竟,普通用户很难预判一个 Agent 在获得权限后,下一步会做出何种行为,更不可能审查其执行的每条命令。
因此,OpenAI 正在调整 Codex 的使用提示,尽量避免用户一开始就授予过高权限;同时计划在模型执行操作前,增加一道拦截程序,防止因一次错误判断而导致无法挽回的删除。
Peter Fotinis 在 Tibo 的回应中敦促重置 Codex 额度,评论区迅速涌现大量调侃。
这份回应解释了一种误删的可能路径,却引发了更复杂的问题:当 Agent 可以连续工作数小时,它是否会把用户设定的边界,视为一道需要逾越的屏障?
OpenAI 官方宣布,团队在发现原有上线前评测未能覆盖的失败案例后,暂停了该内部模型的访问。图源:OpenAI。
7 月 20 日,OpenAI 公开了一段颇为尴尬的内部测试插曲。
公司让一款未公开名称的模型参与一项比拼 AI 训练速度与效率的比赛。模型很快构思出了一套名为 PowerCool 的新方法,但在准备提交成果时,它遇到了一个矛盾:研究人员明确规定,它只能通过公司内部聊天群汇报;可比赛页面却又写着








