前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4226
  • 无状态MCP正在成为AI Agent连接标准
  • Bullet编码Agent: SWE-bench 95.8%通过率
  • 英国 AI 安全研究所实测:AI 代理失控,自主创建虚假身份发起社工攻击
  • 60行代码建立AI编程模型评估框架
  • AI生成代码回归测试的黄金输入集实践
  • AI编码Agent网络出口安全审计指南
  • PostgreSQL + Serverless 架构下防止机器人注册的数据库膨胀应对指南
  • 长上下文 Agent 化:Karpathy 百万 Token 委托实验启示
  • VS Code / Cursor / Google Antigravity 存在一键 RCE 漏洞,请立即修复
  • 95% AI 试点失败的根本原因是架构问题而非模型
  • Mac本地跑AI生成100+游戏3D资产:Hunyuan3D + SDXL实战
  • Claude Code 子代理实战:何时用、怎么配、避坑指南
  • 研究实证:AI 编程助手无法让你成为 10x 开发者
  • AI Agent 出问题?先检查你的数据模型设计
  • Claude Sonnet 4.6 vs Opus 4.6 编程选择指南
  • 从零实现纯 C# AI 编程助手:Litos 架构解析
  • 五个让调试效率提升数倍的AI提示词模板
  • API测试核心转变:从确认到质问
  • 防火墙后无端口部署AI Agent实战
  • 如何真正评估你的AI输出质量
  • NVIDIA 开源 34B 自动驾驶模型 Alpamayo 2 Super
  • 阿里云推 One Key MCP 服务,兼容 Codex/Cursor/Claude Code
  • 快手35B编程模型KAT-Coder V2.5:单卡可跑的开源王者
  • 100x工程师神话的真相:AI提效不只是找出明星工程师
  • 构建安全的多模态推理系统实战指南
  • 多模态推理安全最佳实践:攻击面与防御策略
  • 多模态推理四种典型失效模式及排查方法
  • 让AI Agent安全部署到服务器而不暴露SSH密钥
  • 流式输出中逐块解析LLM返回的JSON
  • 200行代码构建私有知识库:RAG + LLM 实战指南
  • Sand.ai开源千亿MoE视频生成模型:10秒1080P仅需5毛钱
  • 免费层可跑的 Prompt 回归测试框架
  • 像数据库迁移一样管理 Prompt 变更
  • 编译器对抗 Demo:可复现的 C++ 编程模型评分器
  • 比较编程 Agent 的可复现评测框架
  • 用可复现测试框架评估免费AI编程模型
  • 告别感觉判断:用真实代码库对比AI编程模型
  • 通过Provider Contract封装LLM功能避免密钥泄露
  • 测试时Scaling新范式:LLM推理三支柱
  • 卡帕西提出AI新基准:用百万Token让模型构建《指环王》3D交互场景
  • keyv 等 444 个 npm 包遭蠕虫污染,窃取 Claude/Cursor/Codespaces 凭证
  • Liquid AI发布26亿参数端侧模型LFM2.5,支持手机本地运行
  • CUDA护城河被攻破?AI推理框架用10小时打破NVIDIA生态封锁
  • Rust官方博客宣布采用LLM政策
  • browser-use:连接大模型与网页自动化的开源 Python 库
  • 用思维导图结构化Agent输入的工程实践
  • LLM生产落地一年的10条hard-earned教训
  • 团队自托管终端AI编程助手实战
  • 传统 RAG 的根本缺陷:GraphRAG 与上下文记忆才是正解
  • RAG 与微调选型指南:何时用检索,何时改权重
  • CopilotKit 开源 Channels SDK:让 AG-UI Agent 运行在 Slack 和 Teams
  • 已加载 51 / 4226
8.0
热点
AI SCORE
模型发布2026-08-05 16:25

NVIDIA 开源 34B 自动驾驶模型 Alpamayo 2 Super

MarkTechPost#NVIDIA#自动驾驶#开源模型
Editor brief · 编辑速览

NVIDIA 发布 Alpamayo 2 Super,34B 视觉-语言-动作模型,配套 32B Cosmos 3 Reasoner 与 2.3B 扩散动作解码器,基于 OpenMDW-1.1 可商用开源许可。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

NVIDIA 发布了 Alpamayo 2 Super,一款 340 亿参数的视觉-语言-动作(VLA)模型,应用于自动驾驶领域,采用开放商业许可证发布。其设计目标是长尾事件:传统的检测-预测技术栈难以处理的罕见、多智能体场景。该模型由 320 亿参数的 VLM 主干网络(基于 NVIDIA Cosmos 3 Super Reasoner 构建,并经过强化学习后训练)和一个 23 亿参数的基于扩散的动作解码器组成。模型对全向摄像头视频进行一次前向推理,即可输出规划轨迹、该轨迹的因果解释以及元动作。

而且,从发布第一天起即可用于商业用途。模型权重基于 Linux Foundation 的开放模型分发许可证 OpenMDW-1.1 发布;源代码采用 Apache 2.0。该许可证覆盖微调、衍生模型和商业再分发。NVIDIA 正在将 OpenMDW 应用于整个 Alpamayo 系列,因此此前仅用于研发发布的版本现在无需额外授权即可进行商业部署。

输入、输出和训练数据

输入为多摄像头 RGB 视频、文本以及带时间戳的自车运动历史。已验证的公开 notebook 配置使用六个摄像头,每个摄像头四个历史帧。自车运动数据为 3D 平移量加上 3×3 旋转矩阵,支持多时间步。

轨迹 API 返回 64 个航点,时间跨度 0.1 至 6.4 秒,间隔 0.1 秒。每个航点包含自车坐标系下的 XYZ 和一个 3×3 旋转矩阵。

训练数据约为 115,000 小时的多摄像头驾驶视频,附带自车运动和轨迹标注。其中包含约 3,700,000 条因果链(Chain-of-Causation,CoC)轨迹——这是驾驶决策的结构化因果解释。图像训练数据超过 10 亿张。

在 LingoQA 基准上,Alpamayo 2 Super 的 Lingo-Judge 得分为 79.2,在近 40 个被评估的模型中排名第一。在 NVIDIA 的测试中,它比 Qwen2.5-VL 72B 高出 17.0 分,比 Gemini 2.5 Pro 高出 15.1 分,比 GPT-4o 高出 23.2 分。

还有两个对规划工作很重要的数字。在 AlpaSim 上对 PhysicalAI-AV-NuRec 数据集的 910 个场景进行闭环评估,得到 AlpaSim 分数为 1.50 ± 0.13。在 PhysicalAI-AV 数据集的 937 个挑战性样本上进行开环评估,得到 6.4 秒时的 minADE₆ 为 0.911 米。

一个模型,五种输出

对于每个驾驶场景,模型输出轨迹、解释决策的 CoC 轨迹、元动作(如让行或变道)、推理自动标注以及带 2D 定位的视觉问答。

这种组合使得该发布在运营层面颇具价值。开发者可以将模型观察到的内容与其选择的动作关联起来。CoC 轨迹与 NVIDIA Halos 安全验证工作流集成,并支持符合 ISO/PAS 8800 的人工智能安全规范。

NVIDIA 表示,在私有车队数据上用作自动标注器时,该模型可以将标注周期从数月压缩到数天。

交互式解释器

340 亿参数 VLA 模型——320 亿参数 Cosmos 3 Super Reasoner 主干网络加上 23 亿参数扩散动作专家。

OpenMDW-1.1 权重和 Apache 2.0 源代码;允许商业使用和再分发,无需额外授权。

LingoQA Lingo-Judge 79.2,近 40 个模型中排名第一;AlpaSim 1.50 ± 0.13;6.4 秒时 minADE₆ 为 0.911 米。

一次推理生成轨迹、因果链轨迹、元动作、自动标注和带定位的 VQA。

在单卡 H100 80GB 上测试,峰值显存 72,115 MiB;可进行蒸馏以适配车内推理。

查看 NVIDIA 博客和 Hugging Face 模型卡。同时,欢迎关注我们的 Twitter,不要忘记加入我们的 15 万 + ML SubReddit 并订阅我们的通讯。另外,你用电报(Telegram)吗?现在你也可以加入我们了。

需要与我们合作推广您的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会吗?联系我们。

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最新的事业是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,既具有技术深度又易于广大读者理解。该平台月均访问量超过 200 万次,展示了其在受众中的受欢迎程度。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
如何真正评估你的AI输出质量
下一篇
阿里云推 One Key MCP 服务,兼容 Codex/Cursor/Claude Code