NVIDIA发布Cosmos-H-Dreams生成模型,为手术机器人提供实时物理仿真,加速机器人设计迭代。
Cosmos-H-Surgical-Simulator 是一个建立在 NVIDIA Cosmos-Predict2.5-2B 基础上的动作条件化世界基础模型,在 Open-H-Embodiment 数据集上进行了后训练。给定一个手术背景帧和一个未来机器人轨迹,它生成视频展示这些操作可能产生的视觉后果。这使其对离线策略评估和合成数据生成很有用。可以将一条记录或策略生成的轨迹发送到模型,生成对应的展开过程,并且可以检查结果或评分,而无需在物理机器人上重复执行操作。
Cosmos-H-Dreams 将模型推入实时域。从 Cosmos-H-Surgical-Simulator 学习的多身具手术先验开始,我们针对 da Vinci Research Kit(dVRK)桌面缝合进行了专门化,并将其蒸馏为一个因果型学生模型,该模型自回归地生成场景。所发布的模型接收初始 RGB 帧和机器人运动学的实时流,然后在继续处理下一个动作块之前生成下一块帧。
我们还通过与 CMR Surgical 和 Cambridge Consultants 合作,演示了 Cosmos-H-Dreams 的多功能性,将其与 Versius 外科医生控制器集成,在 Versius 平台上实现实时操作。
关键的挑战是在保持有用的手术动态的同时减少生成成本。Cosmos-H-Dreams 使用一个为长自回归展开设计的师生训练管道。
双向教师从 Cosmos-H-Surgical-Simulator Open-H 检查点开始,它使用统一的 44 维动作表示。对于发布的 dVRK 桌面模型,双臂 dVRK 动作内容(包括相对末端执行器平移、旋转和夹爪状态)被映射到这个通用表示中。
教师随后在 JHU dVRK 桌面混合集上进行了微调,包括成功的演示以及失败和分布外事件,如针掉落、投掷失误和不成功的打结。这些失败很重要:一个旨在评估策略的模拟器必须再现不良动作的后果,而不仅仅是理想演示。
为了改进长展开期间的稳定性,训练过程逐步增加教师的时间视野。我们从 12 帧的视野开始训练,逐步增加到 72 帧。在每个视野增加时,我们用预训练权重初始化热启动模型。
教师的去噪轨迹首先被预计算和缓存。一个因果型学生从教师初始化并训练以模仿这些缓存的轨迹。这个预热阶段教导学生在开始从自己生成的历史学习之前,使用因果注意力和流式键/值缓存进行操作。
自回归模型面临一个熟悉的问题:在训练期间它们可能看到干净的基真值背景,而在部署期间它们必须以自己不完美的输出为条件。因此小错误可能随时间复合。
Cosmos-H-Dreams 通过自强制蒸馏解决了这个不匹配问题。在训练期间,学生使用自己生成的背景向前展开。来自冻结教师的分布匹配监督随后引导这些自生成的展开走向逼真的手术视频。这为学生准备了与其在交互推理期间遇到的相同条件。
生成的模型支持少步骤扩散,每个隐空间帧只需要两个去噪步骤,而不是完整教师使用的许多步骤过程。它结合了教师的手术先验与流式所需的因果结构。
模型蒸馏只是实时故事的一部分。Cosmos-H-Dreams 通过 FlashDreams 提供服务,FlashDreams 是用于自回归世界和视频模型的加速推理库。
FlashDreams 通过几个互补的优化(如流式 KV 缓存、CUDA Graph 捕获或模型编译)将蒸馏的学生转化为低延迟流式系统。
这些技术共同将蒸馏的手术世界模型微调从标准 Cosmos-H-Surgical-Simulator 推理的大约每秒十帧提升到交互操作(~每秒 160 帧),运行在单个 NVIDIA RTX PRO 6000 上。
Cosmos-H-Dreams 还提供人机交互界面,将生成转化为交互。浏览器客户端可以发送键盘命令并通过 WebRTC 接收生成的帧。Meta Quest 客户端可以将跟踪的控制器运动映射到机器人动作并通过 WebXR 显示合成场景。同一模型也可以连接到一个学习的手术策略,生成的观察和预测的动作在闭环内交换。
虽然 Cosmos-H-Dreams 包括一个用于桌面缝合的预训练检查点,但该系统设计得可扩展到您的特定身具。要为您自己的数据集训练实时学生模型,我们在分步指南中提供了教师微调和自强制蒸馏的完整配方。
Cosmos-H-Dreams 开启了手术模拟的新前沿:从真实机器人数据学习、响应足够迅速被"居住"的环境。
直接的下一步是评估比视觉质量更多的东西。一个有用的手术模拟器必须正确响应动作、在长展开期间保持器械和场景结构,并支持转移到物理机器人的结论。这促使了一个新的闭环基准族群:工具尖端到达和姿态精度、夹爪循环保真度、空闲稳定性、反事实动作多样性、长视野漂移,以及模拟和真实策略结果之间的一致性。
实时世界模型也可以成为手术策略开发的主动伙伴。它们可以按需生成罕见的失败,为强化或模仿学习提供可扩展的环境,并实现对新策略的快速评估,无需将每个实验都与稀缺的机器人硬件相关联。
更远期,实时模拟使一系列下游应用成为可能,如延迟感知远程手术,其中世界模型帮助维持更稳定的显示;或交互式手术排演、手术规划和术中决策支持。Cosmos-H-Dreams 是一个研究和开发平台,不是诊断系统、术中成像的替代品或物理手术机器人的控制器。但它为安全地探索这些可能性提供了基础。
随着模型保真度、时间稳定性和硬件效率的持续改进,实时生成模拟可以帮助在一个共享的物理 AI 环境内连接外科医生教育、合成数据生成、策略训练和策略评估。
探索 Cosmos-H-Dreams 背后的模型、数据和运行时:
Cosmos-H-Dreams 代码和示例:GitHub 仓库
Cosmos-H-Dreams 模型:Hugging Face 检查点
Cosmos-H-Surgical-Simulator:Hugging Face 模型和 GitHub 仓库
适配您自己的数据:教师微调和自强制蒸馏的分步配方
Open-H-Embodiment:Hugging Face 数据集
FlashDreams:GitHub 仓库
NVIDIA Cosmos-Predict2.5:GitHub 仓库
Cosmos-Surg-dVRK:基于世界基础模型的手术机器人策略学习的自动在线评估(arXiv 论文)
Cosmos-H-Dreams 将动作条件化的手术世界建模带入实时循环,创建了一个让人和策略来练习、探索、生成数据并评估接下来会发生什么的新环境。