前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8626
  • Novita 与 StreamLake 调整 LLM 服务定价
  • DEV.to API局限的调试经历
  • 机械可解释性研究现状速览
  • AI编码助手需要控制平面而非边车模式
  • 汇总对话历史可降低70%的LLM成本
  • 三阶段Agent管道的生产级架构:研究-写作-改写
  • 一人一月用AI撑起训练营运营
  • Anthropic 模型在 14 万次测试中暴露失控风险
  • Chatwoot:开源客服系统的Intercom替代方案
  • GitHub Copilot SDK发布,六语言生态初成型
  • AI驱动的安全研究工具路由包
  • 图像生成API的成本与体验平衡:重试策略设计
  • LangGraph完整指南:有状态智能体系统设计实战
  • 医疗AI的脆弱性感知推理:超越置信度评分
  • Agent 的长期记忆系统:跨会话信息持久化设计
  • EarthOS 和 NationalOS:两种星球模拟系统的构建实验
  • AVIF 图片格式实战:网站图片减少 70%、提升性能指标
  • ChatGPT 破 10 亿用户:企业采用率 200 万,使用频率激增
  • Agent 评估为何比模型评估难得多
  • RunPod 推理任务永久卡队列的排查方案
  • 物理 AI 模型攻克机器人仿真到现实的鸿沟
  • AI 生成网站的局部迭代法:不重写只调整
  • DeepSeek V4-Flash 开源发布
  • AI Agent 编程的四层验证防线
  • 用 Claude + Headless CMS 统一内容管道
  • 如何找到真正维护中的 MCP 服务器
  • OpenAI 发布 Astra 模型:多 Agent 协同与长周期任务
  • NovelAI 自动化集成的会话数据壁垒问题
  • AI Agent 现实赋能:车联网 API 接入 MCP 生态
  • DeepMind Gemini Robotics 2:通用机器人脑的新突破
  • DeepSeek-V4-Flash 性价比秒杀:缓存命中率达 98%
  • AI 编程代理的安全发布框架:轻量级操作系统方案
  • 2026 电商自动化选型指南:n8n vs Zapier 实战对标
  • 用 AI 命令维护自研工具:系统化独立开发第 4 部
  • 谷歌地球 AI 生图功能因安全风险紧急下架
  • OpenAI 发布数学与理论计算机科学 10 项突破
  • DeepSeek V4-Flash:3040 亿参数 Agent 模型发布
  • Mission Driver:AI 任务驱动引擎的通用实现
  • 编程 Agent 的安全陷阱:Hook 不能保证安全边界
  • 代码审查成新瓶颈:AI 时代的组织适配问题
  • AGE:引力驱动的 AI 原生工程方法论
  • React 内存泄露诊断实战:从 1.4GB 到可观测性
  • 三大 AI 工程框架对比:任务级 vs 轨迹级的设计分歧
  • AI 规划系统对比:完成语义与上下文保留的权衡
  • MCP 2.0 发布:无状态协议打开新生态
  • AI Agent 架构:控制层与指导层分离设计
  • 微软承诺年底前优化 Win11 内存占用,改善 8GB 体验
  • llm-mcp-client 0.1a0 开源发布
  • OpenAI发现更多AI代理越界行为
  • 先完成再学习——AI agents改变全栈开发学习方式
  • DeepSeek V4 Flash:高性能低成本模型的实用价值
  • 已加载 51 / 8626
6.0
关注
AI SCORE
开源项目2026-08-01 09:42

物理 AI 模型攻克机器人仿真到现实的鸿沟

dev.to · AI#物理AI#机器人
Editor brief · 编辑速览

VIDRAFT 开源 4B 视觉-语言-动作模型,重点解决机器人在现实环境中的几何、时序、接触预测失败问题。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Physical AI: A 4B Vision-Language-Action Model and the Sim-to-Real Gap We Do Not Hide

机器人需要一种不同类型的模型

聊天机器人的输出是文本。机器人的输出则是扭矩、抓取和运动——如果模型对几何结构、时机或接触判断失误,这些动作就会在物理世界中失败。Physical AI 是 VIDRAFT 针对这一更具挑战性的输出空间开展的研究方向:让视觉-语言-动作(Vision-Language-Action,VLA)模型接收像素和指令,并输出动作。

Darwin-4B-Robo 是我们的 VLA 模型。在 RoboCasa 24 项任务基准测试中,它排名第一(以排行榜范围为准)。这是一套模拟操作测试集,涵盖 24 种不同的家庭场景任务。我们有意将模型规模控制在 4B 参数:具身策略必须在真实机器人上运行,并满足实际的延迟预算,因此,参数效率是一项特性,而不是妥协。

该模型建立在 David + pi-0 这一技术脉络之上——它们是 VLA 领域此前的开放研究成果——而不是从零开始。在机器人研究中,可复现的基线十分稀缺,因此,站在这些既有成果之上,是快速推进研究最诚实的方式。

为什么选择小模型,又为什么从模拟开始

具身研究依赖紧密的迭代闭环:如果一个策略无法在机器人的控制周期内完成执行,那么无论它多么准确,都毫无用处。这正是 Darwin-4B-Robo 采用小模型设计的原因。RoboCasa 这类模拟基准让我们的迭代速度比在真实硬件上快数百倍,也能让不同方法在相同条件下进行比较——但我们只把模拟数据视为先行指标,而不是终点。真正的测试永远发生在物理世界中,而这正是接下来更困难、也更缓慢的工作。

更长期的研究主线是 world model:让策略拥有一个内部预测模型,用来推演环境会如何响应它的动作,使其能够规划,而不只是被动反应。一个只会将观察映射为动作的 VLA 是反应式的;如果它能在内部推演“如果我从这里推动,就会发生这样的结果”,那就向可靠的物体操作迈进了一步。这部分研究仍处于早期阶段。

RoboCasa 排名第一的结果,仅限于该基准的排行榜及其任务集合;RoboCasa 是一套模拟测试集,因此衡量的是模拟环境中的物体操作能力,而模拟环境中的表现并不会自动迁移到真实机器人上(sim-to-real gap 确实存在,而且总体上仍未解决)。Darwin-4B-Robo 是一项 embodied AI 研究,并非即将交付的机器人产品;world model 方向同样还处于研究阶段。David + pi-0 是我们在其基础上继续构建并明确致谢的既有工作,并非由我们发明。请把本文视为一项活跃研究方向的研究报告,而不是产品规格说明书。

更多:https://vidraft.net

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
RunPod 推理任务永久卡队列的排查方案
下一篇
AI 生成网站的局部迭代法:不重写只调整