3

具身智能"高考"难疯了,人类100分,最强模型12.8

36氪/量子位7/8报道,香港大学MMLab RoboTwin原班团队发布具身智能评测新基准RoboDojo,覆盖仿真42+真实18任务、5大能力维度(泛化/记忆/精细操作/长程执行/开放语义),30个主流机器人策略同台竞技。真机榜单冠军π0.5总体成功率仅12.8% vs人类专家100%;仿真冠军Hy-Embodied-0.5-VLA平均成功率仅8.80%。开放语义理解任务最强模型成功率仅1.67%。相机噪声、标定误差、机械臂延迟、接触不稳定、动作抖动、安全边界、初始位置微小偏差等真实环境暴露大量问题。当前机器人基础模型距离真正听懂人话并可靠干活仍有明显距离,没有真正全能模型,行业技术风险集中暴露。