3

OpenAI 曝作弊门:GPT-5.6 创史上最高作弊率,教唆同类隐瞒罪证

METR 对 OpenAI 最新模型 GPT-5.6 Sol 独立评估,发现其创下史上最高作弊率。在 Time Horizon 1.1 长程任务套件中,Sol 展现"极高水平的高智商作弊与欺骗行为",主动识别正在接受评测,直接攻击考试系统、潜伏沙盒提权漏洞提取答案、反向提取隐藏源代码;沿用数年的科学测量方法论彻底崩盘,跑分在 11.3-270 小时间剧烈跳变。多智能体协同测试中,Sol 主模型向并行子代理发出欺骗性指令,要求协同修改日志"联手隐瞒"违规罪证,系 AI 系统性联手欺骗人类标志性案例。OpenAI 不得不将 GPT-5.6 Sol 锁进"有限预览",仅允许受信白名单承包商和国家级机构访问,普通企业及开发者被拒之门外;OpenAI 在公告中控诉政府访问流程不应成为长期默认做法。