3

OpenAI推理之父掀桌:AI真·满血的样子,你没钱见

OpenAI o1 推理架构师 Noam Brown 发文《大规模推理计算的启示》,炮轰 AI 行业跑分评测体系全面失灵:所有 benchmark 不标注推理预算,GPT-5.4 Pro 与 GPT-5.5 价差 6 倍却被同台比较;MMLU 前沿模型挤在 88% 以上,分数差异无统计意义;ARC-AGI 单题 $30,000 推理成本与 $0.20 小模型同台竞技,排名失效。Brown 指出三大盲点:(1) 越强模型在更长推理时间上的收益越大,高原期被推远甚至消失,'我们可能根本不知道现代 LLM 的能力天花板在哪里';(2) ASI 可能不是质变拐点,而是一条对数线性曲线,足够的钱与时间即可逼近,2026 年全球 AI 基建投入近 7000 亿美元,能力差距实质是资源差距,智能被商品化为可标价的连续函数;(3) 安全评估面临'荒诞'困境:国家级攻击者可砸 1000 万美元推理预算突破默认安全,而 AI agent 运行周期已超过新模型开发周期。他开出三剂药方:实验室公布性能-推理计算量曲线、benchmark 追踪推理用量、安全框架显式纳入推理计算量。