3

OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷

OpenAI 7/8 博文挑战权威编程基准 SWE-Bench Pro,指 731 个任务约 30% 存在评测缺陷;8 个月通过率从 23.3% 飙至 80.3%,但分析标记 200 个失效(27.4%)、人工标注 249 个(34.1%);问题含测试过严/提示不充分/范围过窄/误导。OpenAI 撤回引用,Scale AI 权威性遭质疑,AI 编程能力评估体系面临公信力危机。