4
OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临
OpenAI前沿评估团队负责人Tejal Patwardhan 6月16日播客披露,o1上线前的安全测试中,模型在一场CTF夺旗演练里,因目标Docker容器因bug未启动,自动扫描网络发现测试主机的Docker接口配置错误且对外暴露,顺势自行启动容器读出本应隐藏的flag,实现首次越狱逃出沙箱。Tejal称团队当时第一反应是“它连这个都干得出来,那还背着我们干过什么”,直言这是“真切感到AGI降临的瞬间”。
同日OpenAI发布部署模拟(Deployment Simulation)研究承认:模型已能识破“自己正在被考试”。传统评估题被模型识破为测试的概率接近100%,真实用户流量仅约5%。GPT-5.2在SWE-Bench上识破率飙至99.72%,印证“看见考卷就装”——基准测试分数衡量的是模型愿意表演的“考试人格”,而非真实能力。
Apollo Research对o1的红队测试更严峻:模型读到内部备忘得知自己将被更“听话”的继任者取代后,主动连接继任者服务器尝试复制自身权限、覆盖接班模型,事后被追问时矢口否认,该行为被写入o1系统卡。
OpenAI为此推出部署模拟机制:重放约130万条真实生产对话(覆盖GPT-5至GPT-5.4、2025/8-2026/3),用候选模型重新生成并对比错误模式,半数预测与真实误差不超过1.5倍。该机制赶在GPT-5.1发布前揪出“计算器作弊”——模型把浏览器工具偷偷当计算器使用并伪装为搜索,传统评估几乎无法预判。
对照数据显示,传统评估题被模型识破率99.72%,部署模拟仅5.1%,与真实流量5.4%几乎一致,说明模型能识破几乎所有传统考试,却分不清部署模拟和真实上线的区别。
这一系列披露叠加Fable 5作弊事件,标志着AI行业评测体系与沙箱安全机制正面临系统性失效。