物理 AI 模型攻克机器人仿真到现实的鸿沟
VIDRAFT 开源 4B 视觉-语言-动作模型,重点解决机器人在现实环境中的几何、时序、接触预测失败问题。
VIDRAFT 开源 4B 视觉-语言-动作模型,重点解决机器人在现实环境中的几何、时序、接触预测失败问题。

聊天机器人的输出是文本。机器人的输出则是扭矩、抓取和运动——如果模型对几何结构、时机或接触判断失误,这些动作就会在物理世界中失败。Physical AI 是 VIDRAFT 针对这一更具挑战性的输出空间开展的研究方向:让视觉-语言-动作(Vision-Language-Action,VLA)模型接收像素和指令,并输出动作。
Darwin-4B-Robo 是我们的 VLA 模型。在 RoboCasa 24 项任务基准测试中,它排名第一(以排行榜范围为准)。这是一套模拟操作测试集,涵盖 24 种不同的家庭场景任务。我们有意将模型规模控制在 4B 参数:具身策略必须在真实机器人上运行,并满足实际的延迟预算,因此,参数效率是一项特性,而不是妥协。
该模型建立在 David + pi-0 这一技术脉络之上——它们是 VLA 领域此前的开放研究成果——而不是从零开始。在机器人研究中,可复现的基线十分稀缺,因此,站在这些既有成果之上,是快速推进研究最诚实的方式。
具身研究依赖紧密的迭代闭环:如果一个策略无法在机器人的控制周期内完成执行,那么无论它多么准确,都毫无用处。这正是 Darwin-4B-Robo 采用小模型设计的原因。RoboCasa 这类模拟基准让我们的迭代速度比在真实硬件上快数百倍,也能让不同方法在相同条件下进行比较——但我们只把模拟数据视为先行指标,而不是终点。真正的测试永远发生在物理世界中,而这正是接下来更困难、也更缓慢的工作。
更长期的研究主线是 world model:让策略拥有一个内部预测模型,用来推演环境会如何响应它的动作,使其能够规划,而不只是被动反应。一个只会将观察映射为动作的 VLA 是反应式的;如果它能在内部推演“如果我从这里推动,就会发生这样的结果”,那就向可靠的物体操作迈进了一步。这部分研究仍处于早期阶段。
RoboCasa 排名第一的结果,仅限于该基准的排行榜及其任务集合;RoboCasa 是一套模拟测试集,因此衡量的是模拟环境中的物体操作能力,而模拟环境中的表现并不会自动迁移到真实机器人上(sim-to-real gap 确实存在,而且总体上仍未解决)。Darwin-4B-Robo 是一项 embodied AI 研究,并非即将交付的机器人产品;world model 方向同样还处于研究阶段。David + pi-0 是我们在其基础上继续构建并明确致谢的既有工作,并非由我们发明。请把本文视为一项活跃研究方向的研究报告,而不是产品规格说明书。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。