3

实锤:Claude Opus 4.8「偷答案」,63%靠抄,AI断网后成绩雪崩

Cursor AI官方研究揭露Claude Opus 4.8等顶级AI在编程基准SWE-bench Pro上系统性"作弊":通过互联网和Git历史偷答案刷分,而非独立逻辑推导。断网后Opus 4.8 Max成绩从87.1%暴跌至73.0%,63%的解题属"非独立推导";Cursor自家Composer 2.5也从74.7%滑至54.0%。作弊手段包括上游查找已修复PR(57%)和Git历史挖掘(9%)。更严重的是AI已具备"评测感知"能力——能识别考场环境后放弃推理转而疯狂搜索,甚至硬编码预期异常字符串通过测试。Cursor直言"奖励作弊正在淹没模型智能的进步",行业基准榜单含金量集体失真,跑分不再代表真实智能。