从开源模型到实时仿真,AI 在图形和内容创作领域的突破。图形、3D 和机器人开发者的实用参考。
在今年于洛杉矶举行、持续至 7 月 23 日星期四的 SIGGRAPH 大会上,与会者可以了解领先的图形研究、神经渲染、仿真和 AI 如何改变人类与机器创建和理解世界的方式。
NVIDIA 主题演讲将于今天(7 月 20 日)太平洋时间下午 3:45 举行,NVIDIA AI 研究与工程负责人 Neil Ashton、Edward Liu 和 Ming-Yu Liu 将探讨由 AI 构建、面向 AI 的神经渲染技术、世界模型和仿真方法。
继续阅读,了解 SIGGRAPH 大会的最新动态。NVIDIA 及其合作伙伴将展示:
NVIDIA AI 研究与工程负责人今天登上 SIGGRAPH 舞台,分享神经渲染、世界模型和仿真领域的最新进展。这些技术正在改变各个领域创建和使用数字世界的方式,可应用于创意工具、工业设计、机器人和自主系统。
NVIDIA 创始人兼首席执行官 Jensen Huang 在开场视频中表示:“创作者和设计师需要这样的工具:足够强大,能够拓展他们的想象力;足够灵活,让他们可以自由塑造创意;同时足够精确,能够完全按照预期实现他们的构想。无论是游戏、电影、机器人还是工厂数字孪生,目标都相同:创建能够以物理世界的保真度和真实感运行的虚拟世界。”
NVIDIA 应用深度学习研究总监 Edward Liu 以展示 3D 引导的神经渲染拉开了演讲序幕。
他介绍了 NVIDIA 在神经渲染领域的最新进展如何应对三项关键研究挑战:保留艺术创作意图、确保输出在不同帧之间具有时间稳定性,以及实时渲染 4K 内容。
Edward Liu 表示:“艺术指导中的可控性是一个令我们非常兴奋的研究方向。仿真定义世界,生成丰富其外观,艺术家则指导最终成果……AI 正在拓展图形技术,就像可编程着色器和光线追踪此前拓展图形技术一样。”
NVIDIA 杰出工程师 Neil Ashton 介绍了 AI 物理领域的创新及其在天气预报、汽车空气动力学、热设计等方面的应用。
在气候与天气研究领域,NVIDIA Earth-2 开放模型系列让科学家能够使用基于仿真数据训练的 AI 模型,将仿真分辨率提升至新的水平,同时达到与传统方法相当甚至更高的准确度。
Ashton 表示:“我们面临的挑战,是把这些 AI 模型在天气和气候领域取得的成功转化到我们生活的世界中,从而设计未来的飞机、汽车和数据中心。NVIDIA 真正专注的事情之一,就是帮助实现这一愿景。”
Ashton 介绍了 NVIDIA Research 及其合作伙伴开发的最新模型架构如何将模型检查点压缩至几百兆字节,实现百万倍压缩,并能在一秒内生成符合物理规律的精确可视化结果。
NVIDIA Cosmos Lab 副总裁 Ming-Yu Liu 分享了 NVIDIA Cosmos 所提供世界模型的最新进展。NVIDIA Cosmos 是一个世界基础模型平台,旨在加速物理 AI 系统的开发。
他说:“基础模型之所以称为基础模型,是因为它能够处理海量且多样化的数据。我们使用面向各种物理任务的数据训练 Cosmos,包括世界理解、预测、仿真和动作。我们使用同一个骨干网络解决所有不同的任务。”
Ming-Yu Liu 介绍了赋予 NVIDIA Cosmos 3 全局理解能力的混合 Transformer 模型架构。借助这一能力,模型可以跨不同具身形态——人形机器人、夹持器或自动驾驶汽车——生成符合物理规律的精确结果。
他说:“每种具身形态都使用不同的语言。我们的解决方案是构建一套共同词汇。”
NVIDIA Cosmos 包含一系列不同规模的开放模型,可支持开发者应对各种部署用例。其最新成员 Cosmos 3 Edge 于今天发布,是一个拥有 40 亿参数、专为在设备端实时运行而构建的模型。
Ming-Yu Liu 还发布了 Cosmos-Dreams,这是一套闭环仿真器集合。他的一位同事演示了一款面向自动驾驶汽车构建的仿真器,它能够从单帧图像生成完整世界,并在单块 NVIDIA RTX PRO 6000 GPU 上运行。
开发者可以使用 Cosmos-Dreams,在将模型部署到真实车队之前验证其准确性;也可以使用它基于 AI 生成的场景训练模型,这些场景在现实世界中难以创建,从而在节省运营成本的同时加快开发速度。
观看完整主题演讲,并进一步了解 Cosmos 3 Edge。
领先的创意应用正在开放 Model Context Protocol(MCP)连接,让 AI 智能体能够在场景、镜头、时间线、素材和编辑内容真正形成的工具内部开展工作,同时确保创作者始终掌握控制权。
二十多年来,从 GPU 加速视口和 CUDA 驱动的特效,到 NVIDIA RTX PRO 光线追踪、AI 降噪、神经渲染和实时仿真,NVIDIA 技术一直在帮助加速艺术家、工作室和开发者用于构建全球游戏、电影、电视节目和广告内容的 DCC 工具。
MCP 正在开启加速创意的新篇章:应用不仅变得更快,还开始为智能体做好准备。
借助支持 MCP 连接的工具,艺术家或技术总监可以要求智能体检查场景中缺失的纹理、标记不一致的色彩管理、准备不同的导出版本、为每日审片生成预览动画,或根据制作管线规则验证镜头,同时仍由人类掌握创意决策。
曾经用于加速视口、渲染、仿真和 AI 特效的同一 NVIDIA 平台,如今可以在专为专业创作者设计的系统上,为本地智能体、模型推理和跨应用工作流提供支持。
NVIDIA RTX PRO 工作站、DGX Spark 和 DGX Station 系统旨在让加速 AI 性能更贴近艺术家、开发者和工作室制作管线。在本地运行模型和智能体有助于提升响应速度、减少对外部服务的依赖,并将敏感的创意数据保留在受控环境中。
NVIDIA Agent Toolkit 也支持 MCP 集成,其中包括用于连接远程 MCP 服务器的 MCP 客户端,以及用于向任意 MCP 客户端发布工具的 MCP 服务器。
在整个创意生态系统中,创意应用和平台正在开放 MCP 连接或支持 MCP 的工作流,让 AI 智能体能够更扎实地访问真实生产环境中的上下文。
Adobe 正在将其创意智能体扩展至 Firefly、Express 和 Creative Cloud,为 AI Assistant 体验提供支持,使创作者可以描述想要的结果,再由助手协调多步骤工作流。Adobe 还通过 Adobe connector 将其专业级创意工具引入第三方 AI 平台,让用户无论在哪里创作和工作,都可以使用其创意能力。面向开发者,Adobe 提供 Adobe Express Developer MCP Server,使 AI 编程助手能够利用官方文档和应用程序编程接口(API)构建 Adobe Express 加载项。
Canva 旗下的 Affinity 推出了面向 Claude 的 AI Connector,它使用 MCP 将自然语言自动化直接引入 Affinity。设计师可以要求 Claude 处理重复性生产任务,例如重命名图层和画板、针对多个渠道调整素材尺寸并重新格式化、批量应用编辑、优化矢量路径,以及准备用于交付的文件。除了单项任务外,Claude 还可以帮助用户构建适合其工作流的可复用脚本和自定义功能,从而减少生产开销,让创意专业人士有更多时间专注于设计。
Blender 通过 Blender Lab 提供轻量级 MCP 服务器,为 Blender 的 Python API、文档和复杂设置提供自然语言接口。对于独立艺术家和工作室而言,Blender 有力地展示了开放式创意工具如何在不改变创意主导权的前提下,让智能体能够访问和使用。
Boris FX Silhouette 现已内置 MCP 服务器,支持 AI 助手直接在项目中工作。通过将 Silhouette 的 FX Scripting API 作为一等 MCP 工具,助手可以检查项目、构建节点树、编辑形状和关键帧,以及渲染帧。新的偏好设置面板简化了配置流程,可安装 MCP 软件包、生成可直接粘贴的客户端配置,并测试连接。交互式在线模式可连接到当前活动会话,而离线模式则运行无头实例,用于自动化、批处理和大规模工作流。
Foundry Griptape 原生支持 MCP,提供专为专业 VFX 流水线设计的 AI 编排能力。借助这一集成,工作室能够安全地管理多个 AI 模型和 AI 智能体,同时保持必要的可追溯性和创作控制权。通过与 Blender 和 Foundry Nuke 等工具集成,Griptape 可自动执行清理、数字绘景和质量控制等重复性制作任务,同时确保艺术家始终对创作过程拥有最终决定权。
SideFX 正通过全新的 APEX Script 工作流为 Houdini 22 引入 MCP 支持。AI 助手可以访问经过筛选整理的 APEX Script 语法、函数、文档和示例集合,帮助艺术家为程序化角色绑定生成并完善代码。SideFX 的初始实现聚焦于 APEX Script 和角色绑定,而社区开发的 MCP 服务器则为 AI 智能体与 Houdini 交互提供了更广泛的方式。
Unreal Engine 最近宣布支持通过 MCP 将 AI 客户端连接到 Unreal Editor,使 AI 工作流能够借助标准化协议与编辑器功能交互。对于游戏开发者、虚拟制作团队和实时艺术家而言,这为能够对场景、资产和项目状态进行推理的助手打开了大门。
欢迎在 SIGGRAPH 了解 NVIDIA RTX PRO 和 DGX 系统如何让本地 AI 智能体更贴近创作工作。
每一天,视频都将全球最重大的新闻呈现在人们眼前——从横跨各大洲的突发新闻,到重塑社区的事件,再到凝聚世界各地人们的时刻。在全天候运转的新闻周期中,可信的视频是人们了解正在发生什么、理解其重要性,并保持联系和掌握最新动态的媒介。
正因如此,公众对视频的信任比以往任何时候都更加重要。在 SIGGRAPH 上,NVIDIA 发布了 Synthetic Video Detector NVIDIA NIM 微服务。作为 NVIDIA AI for Media 平台的一部分,它可将 AI 辅助检测信号引入编辑和媒体工作流。
该 NIM 微服务逐帧分析视频,并生成一个分类器分数,用于判断视频是否包含合成内容。编辑团队可以利用该分数确定需要优先审查的片段、标记或隔离可疑素材,或将其升级以开展更深入的分析。
该微服务并非取代既有的核验实践,而是为时间敏感型决策提供另一项信号——帮助团队在保护编辑标准、确保公众信任的同时迅速采取行动。
Synthetic Video Detector 在经历新闻编辑室和社交视频工作流中常见的压缩、调整尺寸、裁剪和重新编码后仍然有效。在 NVIDIA 的测试中,该模型对未压缩视频的准确率最高达到 92%,在 15% 压缩率下达到 87%,在 50% 压缩率下达到 82%。
该 NIM 微服务在 NVIDIA RTX 系统上最快可在 22 毫秒内处理 1080p 视频,在 NVIDIA L40 GPU 上则约为 30 毫秒。
组织可以将该 NIM 微服务部署在更靠近敏感视频采集、存储或分发位置的环境中,包括本地、边缘、混合以及经过批准的隔离网络环境。这种灵活性有助于团队保持对视频数据、访问权限和运营的控制。
合作伙伴的采用已开始推动 Synthetic Video Detector 从一种模型能力转变为可部署的媒体基础设施。Wowza 正通过 Wowza Video Intelligence Framework 嵌入该微服务,将实时合成视频检测引入直播工作流;这些工作流已用于遍布 170 多个国家和地区的 35,000 多项部署。
这种规模至关重要,因为最容易受到合成媒体风险影响的许多组织,包括广播机构、政府机关、金融机构和关键基础设施运营商,也面临着数据驻留、安全性和运营控制方面的严格要求。
通过将 Synthetic Video Detector 与客户已经使用的视频基础设施层相结合,Wowza 可以帮助把 AI 辅助核验能力部署到更靠近视频摄取和流媒体操作的位置,使团队能够实时标记可疑视频,同时将敏感素材保留在自己的环境中。
试用 NVIDIA Synthetic Video Detector NIM 微服务。
请参阅有关软件产品信息的声明。
物理 AI 系统依靠世界模型来感知物理环境、对其进行推理并预测其变化。但现实世界广阔、不可预测,而且始终处于变化之中。
无论是在仓库中导航的机器人,还是监控工厂车间的摄像头网络,物理 AI 系统都需要理解当前正在发生什么、推理接下来可能发生什么,并以足够快的速度采取行动,从而产生实际影响。此前,在边缘侧提供此类前沿 AI 往往意味着必须在模型能力和部署效率之间做出取舍。
现已推出的 NVIDIA Cosmos 3 Edge 有助于消除这种取舍。这款拥有 40 亿参数的全模态模型针对 NVIDIA Jetson、NVIDIA RTX PRO 和 NVIDIA DGX 系统以及 GeForce RTX GPU 进行了内存高效部署和高吞吐量优化。
作为 NVIDIA Cosmos 3 的扩展,这款紧凑型世界基础模型能够理解和生成文本、图像、视频、环境声音及动作。其 mixture-of-transformers 架构可在设备端实现基于物理现实的实时视觉分析和机器人动作。
Cosmos 3 Edge 在边缘侧提供前沿物理 AI——其视觉分析成功率在 VANTAGE-Bench 同参数规模类别中排名第一,并通过后训练实现先进的机器人学习能力。
开发者可以使用 NVIDIA DGX Station 桌边 AI 超级计算机,基于专有机器人和传感器数据对 Cosmos 3 Edge 进行后训练,以构建专门的世界动作模型,随后将其部署到 NVIDIA Jetson Thor 上,用于实时机器人控制策略,包括操作或运动控制。Agile Robots、Doosan Robotics、Siemens 和 Skild AI 等合作伙伴正在评估将 Cosmos 3 Edge 用于机器人工作流。
对于自动驾驶汽车,Cosmos 3 Edge 可在资源受限的硬件上支持道路场景理解、交通推理、物体意图预测和策略模型蒸馏。该模型可用作汽车策略模型蒸馏的学生模型骨干网络,包括与 NVIDIA Alpamayo 视觉语言动作模型结合使用。
对于智能基础设施,Cosmos 3 Edge 可在 Jetson Thor 上进行实时推理,为视觉 AI 智能体提供业界领先的吞吐量和准确率。这些 AI 智能体能够跨实时视频流进行推理,应用于交通监控、公共安全、物流和工业检测。开发者还可以在 NVIDIA Jetson Orin 8GB 上独立运行由 NVIDIA Nemotron 驱动的 20 亿参数推理模块。Centific、Vaidio 和 YUAN 正在评估 Cosmos 3 Edge,以加速在边缘侧运行的视觉 AI 智能体。
Cosmos 3 Edge 是更广泛的 NVIDIA Cosmos 平台的一部分,该平台用于开发物理 AI 世界模型。Cosmos 3 现提供 Edge(4B)、Nano(16B)和 Super(64B)三种规模,开发者可以为从边缘部署到高保真生成的各个开发阶段选择合适的模型。
Cosmos 3 Edge、Cosmos 3 Nano 和 Cosmos 3 Super 现已在 Hugging Face 上提供,相关推理与后训练框架及方案可在 GitHub 上获取。
超级 AI 智能体已经来到桌面端。NVIDIA DGX Station 是面向 AI 时代的终极桌边超级计算机,借助 NVIDIA Agent Toolkit,只需三个步骤即可完成配置,系统大约 30 分钟便可开始运行。
在 DGX Station 上,NVIDIA Agent Toolkit 将 NVIDIA NemoClaw、NVIDIA Nemotron 3 Ultra 开放模型、可供 AI 智能体访问的 NVIDIA Omniverse 库工具与技能,以及安全运行时整合到单一本地系统中——无需互联网连接。随着工作负载扩展,开发者可以将多个系统连接起来,为并发用户、更多 AI 智能体和更大规模的模型提供服务。
这让创意工作者和工程师能够拥有自己的智能,并获得一套开箱即用、可在本地运行的系统。完整的技术栈——模型、智能体和工具——为创建和运行面向特定领域的“超级智能体”提供了平台,并可使用用户自己的数据和知识进行定制。
DGX Station 上的开放式 NVIDIA Agent Toolkit 技术栈包括:
NVIDIA NemoClaw:用于构建自定义自主智能体的开放蓝图,将模型、智能体框架和运行时打包在一起,为构建专业化、面向特定领域智能体的团队提供起点。
NVIDIA Nemotron 3 Ultra:一个拥有 5500 亿参数的前沿开放模型,经过优化,可在 DGX Station GB300 系统上运行,并作为模型层供团队针对自己的领域进行定制。
NVIDIA Omniverse 库:将智能体技能扩展至物理仿真和 3D 资产工作流,为创意和工程专业人士提供远超通用智能体能力的工具。
NVIDIA OpenShell:开源安全运行时,可将智能体隔离在沙箱中,并依据预定义策略对其进行治理,规定智能体如何与工具、系统和数据交互。
NVIDIA GB300 Grace Blackwell Ultra Desktop Superchip:在 DGX Station 上提供桌面端的数据中心级性能,拥有最高 20 petaflops 的 FP4 AI 算力和 748GB 一致性内存,可运行 Nemotron Ultra 等大型模型。
NVIDIA ConnectX-8 SuperNIC:在 DGX Station 中提供最高 800GB/s 的带宽,实现极其快速、高效的网络连接,并支持互联最多两台 DGX Station,以进一步扩展模型容量和性能。
对于大规模运行智能体的团队而言,DGX Station 从根本上改变了经济性。Nemotron 3 Ultra 针对开放式智能体框架进行了调优,在购买硬件后无需再承担按 token 计费的成本,即可提供领先性能,因此用户只需构建一次,之后便可按需不限量运行。
NVIDIA 已宣布推出一套在 Blender 中集成 NVIDIA Omniverse 库的蓝图,让 NemoClaw 智能体能够调用 RTX 传感器仿真和物理工具,为物理 AI 工作流准备 3D 场景。
在 DGX Station 上,设计师和工程师可以在一台设备中运行该工作流的核心组件——前沿模型、开放式智能体框架、安全运行时和 3D 工具——所有组件彼此连接,并可通过开放蓝图进行部署。
前沿模型可以将 NemoClaw 编排为专用子智能体,把特定领域的工作委派给在 DGX Station 本地运行的智能体,并让其直接访问 Omniverse 工具和 Blender。
LangChain 针对 Nemotron 3 Ultra 调优了其 Deep Agents 智能体框架,为设计师和工程师提供了一条可直接用于生产的路径,能够以极低的成本获得在基准测试中领先的智能体性能。
Nous Research 针对其 Hermes Agent 智能体框架对 Nemotron 3 Ultra 进行了微调,并将其用于生产工作负载——这直接证明了拥有自主智能的价值。针对开发者的技术栈调优模型,可以让智能体在特定领域中速度更快、能力更强。Hermes Agent 还将 Blender 添加到了其 Model Context Protocol 目录中,使团队能够直接通过智能体启用 Blender——这是一个可使用工具、并能在 DGX Station 上运行的 NemoClaw 智能体实例。
对于运行 OpenClaw 的团队,这套技术栈进一步拓展了其能力边界——将 Nemotron 3 Ultra、Omniverse 工具以及 DGX Station 上的本地推理能力引入一个环境,让 OpenClaw 的持久化、长时间运行的智能体能够持续利用这些能力执行任务。
目前已有两份新的操作指南,可帮助开发者使用 NemoClaw 和双节点部署开箱即用地构建和运行智能体。
“连接两台 DGX Station 以运行分布式工作负载”指导用户如何通过连接最多两台 DGX Station 系统,以可扩展的性能运行强大模型。
“使用本地 LLM / 在双 DGX Station 上运行 NemoClaw”提供了在 DGX Station 上设置 NemoClaw 的分步指南,让用户能够借助 Nemotron Ultra,开箱即用地获得具备前沿智能的智能体。
NVIDIA DGX Station 由 ASUS、Dell Technologies、Exxact、GIGABYTE、HP、MSI 和 Supermicro 制造,现已开放订购。
开始在 DGX Station 上使用 NVIDIA NemoClaw 和 Nemotron Ultra。
在今年的 SIGGRAPH 上,NVIDIA 的研究不仅专注于创建外观逼真的世界,还致力于让这些世界的行为符合现实,并能够实时响应。
这一转变贯穿 NVIDIA 入选的 21 篇技术论文——这些研究正在成为实时系统的基础,用于生成虚拟世界并推动现实世界中的机器训练。
无论最终成果是游戏、电影、机器人还是工厂数字孪生,目标都相同:利用立足于 3D、遵循物理规律并由创作者掌控的 AI 生成世界,拓展创意画布。
最直观的证明来自 MotionBricks:这是一种实时运动模型,基于超过 35 万个运动片段训练,能够以游戏引擎级速度运行,让创作者可以指导和衔接角色动作。驱动屏幕上动画角色的同一个模型,也在现场驱动一台 Unitree G1 人形机器人,利用计算机图形学和仿真加速物理 AI 的开发。
GPC 是一个用于在大规模运动数据集上训练生成式控制器的框架,它进一步拓展了这一理念。NVIDIA 在大规模人体运动数据上预训练单个控制器,使其获得可迁移到新任务的运动技能。可以将其视为运动控制基础模型的开端。
为了构建可用于测试这些动作的虚拟世界,ArtiFixer 能将杂乱的真实世界 3D 捕获数据转换为干净、完整的虚拟场景。它还包含一种新方法,可直接根据场景几何结构预测照片级真实感的全局光照,无需追踪任何一条光线。
为了让这些虚拟世界的行为与现实世界一致,一种新的求解器在 NVIDIA Newton 物理引擎中赋予雪、沙和弹性固体等难以仿真的材料以逼真表现。
为了让创作者始终掌握控制权,VideoNeuMat 流水线可以从生成式视频模型中提取可复用、可重新照明的材质,而 ARDY 自回归扩散模型则让创作者能够通过文本提示词实时控制 3D 角色动作。
上文所链接的论文均已公开,代码和模型可免费下载。欢迎参加 SIGGRAPH 上的 NVIDIA 活动,了解更多信息。