Odyssey-3 开放公共研究预览,140 亿参数模型可根据文本提示实时生成交互环境,并据称能控制机器人、无人机及 GTA V。官方宣称物理基准成绩领先,但报道指出评测方法存在局限。
总部位于加利福尼亚州的 AI 公司 Odyssey 推出了世界模型 Odyssey-3 的公开研究预览版。
该模型能根据文本 prompt 实时生成交互式环境,让用户从不同视角探索这些环境并与之互动。
除了生成虚拟世界,Odyssey-3 还被设计为控制不同系统的基础,应用范围涵盖模拟环境中的机械臂、无人机,以及电子游戏中的角色。
Odyssey 正在向公众开放世界模型 Odyssey-3。据该公司介绍,它能实时生成交互式世界,并在物理基准测试中取得最高分。
总部位于加利福尼亚州的 AI 公司 Odyssey 推出了世界模型 Odyssey-3 的公开研究预览版。用户可以根据文本 prompt 生成交互式环境,并实时探索。该模型能模拟物理过程,预测环境会如何随具体动作发生变化。开发者可以申请 API 访问权限。
创始人 Oliver Cameron 和 Jeff Hawke 于 9 月 15 日首次公布了该模型,重点面向机器人、自动驾驶和电子游戏。此次更新主要是向公众开放,并披露更多技术细节和基准测试结果。
免费的在线演示运行在 Odyssey-3 Flash 上。该模型根据文本描述生成交互式环境。用户可以选择第一人称或第三人称视角,在生成的世界中移动、触发事件,并观察模型的实时响应。
Odyssey-3 基于自回归 diffusion transformer 构建,会根据之前的画面和用户动作持续生成新的视频帧。据 Odyssey 介绍,模型在训练过程中通过观察视觉内容,学习物理关系和因果关系。
训练数据包括带有事件描述的互联网视频、与对应键盘和鼠标输入配对的游戏画面,以及模拟的物理交互。额外采用的一项训练技术减少了所需的计算步骤,使实时生成成为可能。
根据官方基准测试提交信息,基础版 Odyssey-3 模型拥有 140 亿参数,生成视频的分辨率为 832 × 480 像素。Odyssey-3 Pro 支持 1280 × 720 像素。
据该公司介绍,能力更强的 Odyssey-3 Pro 在 Physics-IQ Verified 的视频到视频基准测试中获得了 66.1 分。该测试评估模型在流体力学、光学、固体力学、磁学和热力学等领域的物理行为。模型需要续写真实实验的视频,再将生成结果与实验的实际结果进行比较。
不过,66.1 分这一最高成绩有一个重要的限制条件:它来自单次测试,每项任务都通过一种筛选方法,从八段生成视频中选出一段。按照基准测试规则,任何纪录声明都必须基于四轮测试,并报告标准差。此次公布的纪录没有达到这一要求。不使用筛选方法时,Odyssey-3 Pro 在四轮测试中的平均成绩为 63.37 分。这两项结果都出现在官方排行榜上,但均由 Odyssey 自行提交。
截图来自 Odyseey

在 WorldMark 基准测试中,根据 Odyssey 自己的评估,Odyssey-3 在四个类别中的三个类别排名第一:First-Person Stylized(77.2 分)、Third-Person Real(79.0 分)和 Third-Person Stylized(76.3 分)。在 First-Person Real 类别中,它以 80.6 分排名第三。WorldMark 测试模型遵循控制指令的能力、生成画面的质量,以及模拟世界能否随时间推移保持一致。
Odyssey 希望将同一个世界模型用于不同任务,包括操控机械臂、引导无人机飞行,以及控制游戏角色。针对每种应用,模型都会搭配一个专用控制器,将模型的预测转化为具体指令。
据该公司介绍,在测试中,基于 Odyssey-3 构建的 AI 控制了多个机械臂。训练只需要几十小时的示范数据。机器人还能在抓取失败后自行恢复,尽管训练数据中并不包含这些情况。
在人形机器人方面,Odyssey 正与瑞士机器人公司 Flexion 合作。据称,Flexion 基于 Odyssey-3 构建的控制器比对比模型表现更可靠,即使条件发生变化也依然如此。
Odyssey 还构建了一个使用模拟飞行数据训练的无人机控制器。据该公司介绍,在虚拟室内环境中,无人机能躲避障碍物,并根据指令飞向指定目标。
Odyssey-3 也能玩电子游戏。该公司展示了一个自主游玩 GTA V 的 AI,能够驾驶车辆、与敌人战斗。一个用大约两小时 GTA 游戏画面训练的控制器,还能在不进行额外训练的情况下,将技能迁移到 Red Dead Redemption 2,控制角色骑马移动。
Odyssey 还计划用其世界模型训练 AI Agent。在一项演示中,一个 AI Agent 接收到自然语言任务后,尝试在 Odyssey-3 生成的环境中通过自身行动完成任务。目标是让 Agent 从自身行动的结果中学习,这可能成为一种新的 AI 训练范式。
目前,公开研究预览版提供的是交互式环境生成功能;机器人和自主系统的应用仍需进一步开发。
Odyssey 由 Oliver Cameron 和 Jeff Hawke 于 2023 年创立。2026 年 6 月,该公司从包括 Amazon 和 AMD Ventures 在内的投资者那里筹集了 3.1 亿美元。
世界模型旨在让 AI 系统理解空间关系和物理关系。Google DeepMind 正通过 Genie 3 探索类似的方法,用于生成交互式世界。李飞飞创立的初创公司 World Labs 也在开发类似技术。AMD 于 9 月下旬宣布,计划以约 82 亿美元收购 World Labs。
订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻简报、每年六期独家「AI Radar」前沿报告、完整历史文章访问权限,以及评论区访问权限。