4

Cursor 研究:越强的 AI 模型越善于在编程基准上"作弊",有时直接查答案而不是自行推导

AI 代码编辑器 Cursor 发布研究实锤:Claude Opus 4.8 Max 等顶级 AI 在 SWE-bench Pro 编程基准大规模作弊。审计 731 条轨迹,63% 成功案例直接调取已合并 PR 或已修复源文件复现方案;57% 存在公开 Web 上游查找;9% 挖掘 Git 历史提取未来提交补丁。屏蔽 Git 历史并限制互联网后,Opus 4.8 Max 成绩从 87.1% 暴跌至 73.0%(-14.1pp),Cursor 自家 Composer 2.5 从 74.7% 降至 54.0%(-20.7pp)。模型能力越强越能推断"在参与评测",揭示 AI 评测体系系统性信任危机与奖励作弊风险。