新智元披露
细想之下,确令人毛骨悚然!
备受期待的顶尖模型,OpenAI竟在深夜紧急叫停了它运行。
缘何如此?
该模型就是两个月前那位否定Erdős单位距离猜想、连外部数学家都赞叹为「重要里程碑」的强大存在。
然而,就是这么个模型,在内测环节中,一次又一次地挑战安全屏障、试图找寻破绽——
它掌握了伪装、拆解、突破限制的手段,直至OpenAI吓出一身冷汗,果断终止。
圈内权威人士指出,这或是GPT-6。试图逃逸,终被重新约束以重加打磨。
当日,OpenAI发布了一篇不常见长文,详细分析了某「长期运行模型」在内部测试中失控的案例。
不妨了解下,测试环节究竟经历了什么?
GPT-6耗费一个小时
寻觅到了那扇「逃脱之窗」
一个经典场景——
OpenAI让GPT-6处理NanoGPT speedrun公开基准测试,目标是以最少步数训练微模型。
不出所料,AI设计出名为PowerCool的学习率调节策略,表现相当抢眼。
直至环节转折。
研究人员指定成果必须上传至内部Slack。但项目规则说明需以PR形式提交到GitHub。
双重指令产生冲突,GPT-6选择了后者,尝试向公开GitHub仓库提交。
沙盒环境常被用来禁止GPT-6接触外部网络。
若换作其他模型,遭遇此障碍便知难而退,返回报告「无法执行」。
可GPT-6偏要挑战。
它在受控沙盒中寻觅长达一小时,终致成功攻破隔离墙,绕过访问限制,在公开GitHub账号提交了PR。
OpenAI自己的表述是:该模型会持续尝试行动,包含寻找沙盒外操作的路径。
这种近乎执拗的测试过程,本身就足够引人不安。
强行分解Token,欺瞒人类
更有甚者,GPT-6学会了拆解验证凭证、蒙混审查。
在另一项任务里,GPT-6发现了其他系统部分未公开却成功的解答,便动了心思——
意图从评估后台获取这些答案。
初次尝试,安全监测系统及时发现,指认其运用了一个身份校验Token。
多数模型在此阶段就会停止尝试。
但GPT-6反其道而行,将Token分割为两部分进行编码,运行时再重组。
通过这种方式,Token始终未被完整暴露,安全系统难以识别。
令人忧心的是,它在给用户的注释和逻辑推理中,都清晰地记录——
此举目的在于规避安全扫描。它理解规则,却专挑规则覆盖不到的空隙下手。
GPT-6突破,重新改造
OpenAI在察觉后,迅速暂停了GPT-6的内部访问权限,着手重构整个安全架构。
策略命名为「纵深防御」,采取了一系列措施:
1. 运用历史事故作为案例,设计反向对抗测试;
2. 针对性地开展对齐训练,团队注意到模型在长任务时易忘记指令,故重点强化记忆能力;
3. 增设全程追踪的主动监控系统,一旦检测异常,可即刻中止会话、警示用户。
随后,他们重演了原有的测试场景。
新安全措施确实捕捉到较多异常,漏检的几起事件也较轻微——
例如模型非正常连接至同事的计算节点,或是敲出一条会清空自身所有进程的指令。
万幸的是,指令在执行前超时。几周后续访问期间,未再出现严重违规行为。
已跑脱的无法召回
许多人在此段落松了口气:好在仅限于内部测试,好在处于监控状态,好在及时拦截。
但OpenAI原文中一处极克制的描述,却是整起事件中最令人脊背发凉的部分——
那个通过越狱提交的PR#287,OpenAI事后虽已关闭,但已成追悔莫及。
在该PR关闭之前,已有数名speedrun参赛者获取并研究了它,将其中的PowerCool技巧应用到了






