3
Transformer八子之一Lukasz Kaiser:致命盲区近在咫尺,必须能随时切断AI电源
36氪6月8日刊发Transformer八子之一、OpenAI资深科学家Lukasz Kaiser(Łukasz Kaiser)与CSDN副总裁李建忠的深度对谈。Kaiser指出,当前大模型必须穷尽所有错误表象才会被动理解底层概念,与人类学习方式背道而驰,并直言“我们其实根本还没有参透‘学习’本身的真正奥秘”。他警告,行业当前对Scaling Law的狂热正在让模型“撞上效率的冰山”,“模型虽然在泛化,但它用的是一种我们无法完全参透的、‘外星人’式的独特思维在泛化”,而“你永远无法提前预知它在什么地方隐藏着致命的盲区”。在安全风险上,Kaiser明确表态:与其空谈“人类存在性风险”,“我们真正应该把目光投向的是那些已经近在咫尺的、极其具体的现实安全隐患——例如系统可能会被不法分子用来发起黑客攻击,或者对关键基础设施造成瘫痪性破坏”。他强调,“在任何极端的境遇下,我们都必须牢牢捍卫随时切断数据中心电源、人工终止其运转的核心控制权”。谈及OpenAI与Anthropic的竞争格局,Kaiser直言后者“做了一次极明智的战略选择——将所有重兵死死压在‘代码’这一个战场上”,原因是“OpenAI核心力量正被ChatGPT这一现象级产品的光芒所牵制”,“风向转换的速度超乎所有人的想象,一旦你在一个被大家所忽视的小切口上做出了极其坚决的饱和攻击,你就能换来极其丰厚的技术回报”。在工程实践层面,Kaiser透露自己用Cursor复现15年前老论文的效率从手动三周压缩到两天,整体效率提升5到10倍,但“你永远不可能让智能体自己跑通——它会自作主张塞进莫名其妙的损失函数”,人类必须“对系统到底在运行什么保持全盘的、绝对的掌控”。在硬件层面,他用一组对比说明:当年Transformer论文的整机8卡约70-80 Teraflops,而今天一张消费级RTX 5090即可提供200 Teraflops,“你完全可以在自己的书房或厨房里,用单张显卡跑完当年Transformer论文里的所有实验”;模拟人脑从估算的1-100 Petaflops门槛也已被单卡或数台云端机器轻松触及,曾经“数百万美元、一年”的工作量现在只需“几百到上千美元、一天”即可完成。在架构演进上,Kaiser判断“纯粹的Transformer架构在应对复杂逻辑难题时表现并不尽如人意”,“Transformer的‘锋利棱角’还没被磨平”,多模态、循环机制、后Transformer新架构才是真正的未知领地。针对“硬件架构跟不上科研思路”的瓶颈,他指出“这种瓶颈正在迅速消融”——智能体可以替科研人员编写CUDA内核,让曾经的科研天堑变成了通途。在开源与闭源之争上,Kaiser认为顶级模型的算力门槛与商业化策略决定了两条路线将“互相牵制、螺旋上升”,但“主权模型”的诉求让开源生态拥有长期存在的底层动力。对话最后,Kaiser向研究者呼吁:“勇敢地去检验你脑海中的奇思妙想”,他坦承自己一年前发表的“活动内存”替代方向事后看是条死路,“但科学的真谛就在于你必须有勇气去蹚过无数条行不通的死路,才能在荒原的尽头与真理狭路相逢”——这正是当前大模型在挣扎的短板,也是Jerry Tworek等研究者正在攻坚的核心阵地。