NVIDIA 发布 Alpamayo 2 Super,34B 视觉-语言-动作模型,配套 32B Cosmos 3 Reasoner 与 2.3B 扩散动作解码器,基于 OpenMDW-1.1 可商用开源许可。
NVIDIA 发布了 Alpamayo 2 Super,一款 340 亿参数的视觉-语言-动作(VLA)模型,应用于自动驾驶领域,采用开放商业许可证发布。其设计目标是长尾事件:传统的检测-预测技术栈难以处理的罕见、多智能体场景。该模型由 320 亿参数的 VLM 主干网络(基于 NVIDIA Cosmos 3 Super Reasoner 构建,并经过强化学习后训练)和一个 23 亿参数的基于扩散的动作解码器组成。模型对全向摄像头视频进行一次前向推理,即可输出规划轨迹、该轨迹的因果解释以及元动作。
而且,从发布第一天起即可用于商业用途。模型权重基于 Linux Foundation 的开放模型分发许可证 OpenMDW-1.1 发布;源代码采用 Apache 2.0。该许可证覆盖微调、衍生模型和商业再分发。NVIDIA 正在将 OpenMDW 应用于整个 Alpamayo 系列,因此此前仅用于研发发布的版本现在无需额外授权即可进行商业部署。
输入为多摄像头 RGB 视频、文本以及带时间戳的自车运动历史。已验证的公开 notebook 配置使用六个摄像头,每个摄像头四个历史帧。自车运动数据为 3D 平移量加上 3×3 旋转矩阵,支持多时间步。
轨迹 API 返回 64 个航点,时间跨度 0.1 至 6.4 秒,间隔 0.1 秒。每个航点包含自车坐标系下的 XYZ 和一个 3×3 旋转矩阵。
训练数据约为 115,000 小时的多摄像头驾驶视频,附带自车运动和轨迹标注。其中包含约 3,700,000 条因果链(Chain-of-Causation,CoC)轨迹——这是驾驶决策的结构化因果解释。图像训练数据超过 10 亿张。
在 LingoQA 基准上,Alpamayo 2 Super 的 Lingo-Judge 得分为 79.2,在近 40 个被评估的模型中排名第一。在 NVIDIA 的测试中,它比 Qwen2.5-VL 72B 高出 17.0 分,比 Gemini 2.5 Pro 高出 15.1 分,比 GPT-4o 高出 23.2 分。
还有两个对规划工作很重要的数字。在 AlpaSim 上对 PhysicalAI-AV-NuRec 数据集的 910 个场景进行闭环评估,得到 AlpaSim 分数为 1.50 ± 0.13。在 PhysicalAI-AV 数据集的 937 个挑战性样本上进行开环评估,得到 6.4 秒时的 minADE₆ 为 0.911 米。
对于每个驾驶场景,模型输出轨迹、解释决策的 CoC 轨迹、元动作(如让行或变道)、推理自动标注以及带 2D 定位的视觉问答。
这种组合使得该发布在运营层面颇具价值。开发者可以将模型观察到的内容与其选择的动作关联起来。CoC 轨迹与 NVIDIA Halos 安全验证工作流集成,并支持符合 ISO/PAS 8800 的人工智能安全规范。
NVIDIA 表示,在私有车队数据上用作自动标注器时,该模型可以将标注周期从数月压缩到数天。
340 亿参数 VLA 模型——320 亿参数 Cosmos 3 Super Reasoner 主干网络加上 23 亿参数扩散动作专家。
OpenMDW-1.1 权重和 Apache 2.0 源代码;允许商业使用和再分发,无需额外授权。
LingoQA Lingo-Judge 79.2,近 40 个模型中排名第一;AlpaSim 1.50 ± 0.13;6.4 秒时 minADE₆ 为 0.911 米。
一次推理生成轨迹、因果链轨迹、元动作、自动标注和带定位的 VQA。
在单卡 H100 80GB 上测试,峰值显存 72,115 MiB;可进行蒸馏以适配车内推理。
查看 NVIDIA 博客和 Hugging Face 模型卡。同时,欢迎关注我们的 Twitter,不要忘记加入我们的 15 万 + ML SubReddit 并订阅我们的通讯。另外,你用电报(Telegram)吗?现在你也可以加入我们了。
需要与我们合作推广您的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会吗?联系我们。
Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最新的事业是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,既具有技术深度又易于广大读者理解。该平台月均访问量超过 200 万次,展示了其在受众中的受欢迎程度。