3
具身机器人研究全都错了?最新论文:不能只靠VLA和世界模型
一篇新发表于arXiv的立场论文对当前具身智能主流范式给出否定结论:由Motoniq团队及合作者撰写的论文指出,仅靠更大规模的机器人示范数据、视觉-语言-动作(VLA)模型与世界模型,无法实现通才机器人智能,现有范式存在明显不足。论文认为,物理智能缺失四个关键组件:物理数据引擎与具身自动标注、跨具身的任务保留重定向、物理扎根的世界模型(含不确定性估计)、任务条件化奖励扎根驱动的部署闭环。研究团队强调,未来突破口不在更大模型,而在于补齐上述组件;VLA与世界模型只是整套物理智能系统中的一层,其有效性取决于数据、本体、动力学、奖励与部署反馈的支撑。该论文对当前动辄百亿美元的人形机器人投资热潮与VLA路线构成系统性挑战,具身机器人的“GPT时刻”依然很远。