4

推理成本砍掉一半以上,OpenAI摸着DeepSeek过河

OpenAI 2025 年收入 130.7 亿美元、总成本 340 亿、运营亏损 209 亿;付给微软云计算账单超 172 亿(占总成本 50.6%),2026 年推理+训练再烧 141 亿,Q1 API 毛利率仅 39%。OpenAI 找到新方案将推理成本砍掉一半以上,核心来自 KV cache 复用——2024 年 5 月 DeepSeek-v2 通过 MLA 把 KV cache 减少 93.3%、吞吐提升 5.76 倍,OpenAI 走 DeepSeek 验证过的路。KV cache 与 HBM 强相关:HBM4 单堆栈带宽从 HBM3E 1.18TB/s 翻到 2.8TB/s、容量 24→48GB,但产能被 SK 海力士+三星垄断;英特尔+软银 SAIMEMORY 推出 ZAM 降堆叠与成本但短期难替 HBM。硬件层 6/24 OpenAI 与博通发布 Jalapeño(LLM 推理专用芯片,9 个月开发周期,降本约 50%),叠加 1/14 与 Cerebras 签 750MW 算力百亿美元协议(WSE-3 晶圆级芯片、推理速度比 GPU 快 15 倍、GPT-5.4 已跑通),AWS 跟进做"推理分解"。OpenAI 倾向推迟 IPO 至 2027(受 SpaceX 上市股价不稳影响),警示:"再不控制成本,OpenAI 可能就再也控制不住成本了"——软件优化+自研芯片+第三方算力三路并发,是 AI 头部公司首次围绕"成本结构"全面重构基础设施栈。