3

“Agent的最后一场考试”来了:最强模型得分率仅 8.6%,Claude Code 直接挂零

加州大学伯克利分校牵头、联合 250 余位行业专家发布新基准 Agents’ Last Exam(ALE),面向制造、法律、医疗、视觉媒体等领域的 1490 个真实专业任务,要求 AI 独立完成长期、具经济价值的复杂工作流程。结果显示,主流模型平均完整通过率仅 2.6%,最强配置 Codex + GPT-5.5 在最难档也只有 8.6%。以 Claude Code + Opus 4.7 为例,失败原因中 31% 属于理解问题、47% 属于方法问题、22% 属于执行问题,说明当前 AI Agent 的主要瓶颈在于领域知识而不是执行能力。另一重要发现是,模型选择带来的差异约为 agent 框架的 3 倍,高位 18 个百分点,轻微提示 AI Agent 能力起决于模型本身。该研究对当前热门的 AI Agent 商业化叙事以及“Agent 可替代专业人士”的宣传构成重要修正,证明 AI 在真实、多步骤专业场景下仍需人类参与与监督。论文公开集仅为完整任务池部分,任务池将持续扩展。