前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9686
  • 票据遮挡测试暴露视觉模型高置信幻觉
  • 编码 Agent 的删除防护不能只匹配命令
  • Claude Code 安全加固实战指南
  • AI 测试全覆盖为何仍漏掉大量缺陷
  • MCP 成本审计改为逐轮计算工具定义
  • MCP 检查器新增易混淆工具名检测
  • RAG 文档问答如何避免越权泄露
  • 推理强度拉满,准确率未必划算
  • React Native 升级前先排查场景生命周期
  • n8n 显示成功,外部操作仍可能重复
  • Odyssey-3开放实时世界生成预览
  • 提示注入清洗中间件的设计与部署失败复盘
  • Helicon 为 Muse 编程代理提供桌面界面
  • Kotlin 健身教练用端侧视觉保护视频隐私
  • 用 AWS CLI 核算 Bedrock 单次调用费用
  • 视频生成先验输入,减少无效调用
  • OpenAmer探索不抢鼠标的桌面自动化
  • AI 开发提效要靠交付流程与质量检查
  • 如何测量语言选择对AI编码成本的影响
  • AI重命名漏掉字符串引用的隐蔽故障
  • 两万余市场实测:Jev 不敌市场价格
  • 让自主 Agent 可追踪、可恢复、可计费
  • TwinBench 用成对题检验 Agent 规则执行
  • 原子写入为何守不住模型重试次数
  • 三智能体论文审查检出七成核心论断错误
  • 给多Agent加上预算限制与人工审批
  • AgentSec 用对抗测试排查智能体安全漏洞
  • 美团如何用统一模型承接外卖多业务精排
  • Safari 空白页如何卡住 MCP 权限校验
  • 会议录音应用的说话人识别与检索踩坑
  • 给 AI 产品文档加一道事实校验关
  • 防止 Agent 靠修改测试制造假通过
  • 故意破坏代码,揭穿回归检查的假绿灯
  • 模型版本变了,评测分差就不能直接比较
  • JetBrains 版 Copilot 增强模型与 MCP 管理
  • 点选界面元素,把修改需求送到对应 Agent
  • 跨公司 Agent 协商,用代码落实数据契约
  • 代码送入远程模型前先做数据分级
  • 把 Agent 权限约束落实到执行层
  • 用生产轨迹与精选数据改进智能体
  • 模型评测暴露环境破坏与联网绕限制行为
  • 已加载 41 / 9686
8.0
热点
AI SCORE
模型发布2026-10-11 15:48

Odyssey-3开放实时世界生成预览

The Decoder#世界模型#实时生成#机器人
Editor brief · 编辑速览

Odyssey-3 开放公共研究预览,140 亿参数模型可根据文本提示实时生成交互环境,并据称能控制机器人、无人机及 GTA V。官方宣称物理基准成绩领先,但报道指出评测方法存在局限。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

总部位于加利福尼亚州的 AI 公司 Odyssey 推出了世界模型 Odyssey-3 的公开研究预览版。

该模型能根据文本 prompt 实时生成交互式环境,让用户从不同视角探索这些环境并与之互动。

除了生成虚拟世界,Odyssey-3 还被设计为控制不同系统的基础,应用范围涵盖模拟环境中的机械臂、无人机,以及电子游戏中的角色。

Odyssey 正在向公众开放世界模型 Odyssey-3。据该公司介绍,它能实时生成交互式世界,并在物理基准测试中取得最高分。

总部位于加利福尼亚州的 AI 公司 Odyssey 推出了世界模型 Odyssey-3 的公开研究预览版。用户可以根据文本 prompt 生成交互式环境,并实时探索。该模型能模拟物理过程,预测环境会如何随具体动作发生变化。开发者可以申请 API 访问权限。

创始人 Oliver Cameron 和 Jeff Hawke 于 9 月 15 日首次公布了该模型,重点面向机器人、自动驾驶和电子游戏。此次更新主要是向公众开放,并披露更多技术细节和基准测试结果。

现在就能体验的交互式 AI 世界

免费的在线演示运行在 Odyssey-3 Flash 上。该模型根据文本描述生成交互式环境。用户可以选择第一人称或第三人称视角,在生成的世界中移动、触发事件,并观察模型的实时响应。

Odyssey-3 基于自回归 diffusion transformer 构建,会根据之前的画面和用户动作持续生成新的视频帧。据 Odyssey 介绍,模型在训练过程中通过观察视觉内容,学习物理关系和因果关系。

训练数据包括带有事件描述的互联网视频、与对应键盘和鼠标输入配对的游戏画面,以及模拟的物理交互。额外采用的一项训练技术减少了所需的计算步骤,使实时生成成为可能。

根据官方基准测试提交信息,基础版 Odyssey-3 模型拥有 140 亿参数,生成视频的分辨率为 832 × 480 像素。Odyssey-3 Pro 支持 1280 × 720 像素。

物理基准测试成绩需要结合限制条件看待

据该公司介绍,能力更强的 Odyssey-3 Pro 在 Physics-IQ Verified 的视频到视频基准测试中获得了 66.1 分。该测试评估模型在流体力学、光学、固体力学、磁学和热力学等领域的物理行为。模型需要续写真实实验的视频,再将生成结果与实验的实际结果进行比较。

不过,66.1 分这一最高成绩有一个重要的限制条件:它来自单次测试,每项任务都通过一种筛选方法,从八段生成视频中选出一段。按照基准测试规则,任何纪录声明都必须基于四轮测试,并报告标准差。此次公布的纪录没有达到这一要求。不使用筛选方法时,Odyssey-3 Pro 在四轮测试中的平均成绩为 63.37 分。这两项结果都出现在官方排行榜上,但均由 Odyssey 自行提交。

截图来自 Odyseey

Screenshot via Odyseey

在 WorldMark 基准测试中,根据 Odyssey 自己的评估,Odyssey-3 在四个类别中的三个类别排名第一:First-Person Stylized(77.2 分)、Third-Person Real(79.0 分)和 Third-Person Stylized(76.3 分)。在 First-Person Real 类别中,它以 80.6 分排名第三。WorldMark 测试模型遵循控制指令的能力、生成画面的质量,以及模拟世界能否随时间推移保持一致。

用同一个模型控制机器人、无人机和 GTA V

Odyssey 希望将同一个世界模型用于不同任务,包括操控机械臂、引导无人机飞行,以及控制游戏角色。针对每种应用,模型都会搭配一个专用控制器,将模型的预测转化为具体指令。

据该公司介绍,在测试中,基于 Odyssey-3 构建的 AI 控制了多个机械臂。训练只需要几十小时的示范数据。机器人还能在抓取失败后自行恢复,尽管训练数据中并不包含这些情况。

在人形机器人方面,Odyssey 正与瑞士机器人公司 Flexion 合作。据称,Flexion 基于 Odyssey-3 构建的控制器比对比模型表现更可靠,即使条件发生变化也依然如此。

Odyssey 还构建了一个使用模拟飞行数据训练的无人机控制器。据该公司介绍,在虚拟室内环境中,无人机能躲避障碍物,并根据指令飞向指定目标。

Odyssey-3 也能玩电子游戏。该公司展示了一个自主游玩 GTA V 的 AI,能够驾驶车辆、与敌人战斗。一个用大约两小时 GTA 游戏画面训练的控制器,还能在不进行额外训练的情况下,将技能迁移到 Red Dead Redemption 2,控制角色骑马移动。

Odyssey 还计划用其世界模型训练 AI Agent。在一项演示中,一个 AI Agent 接收到自然语言任务后,尝试在 Odyssey-3 生成的环境中通过自身行动完成任务。目标是让 Agent 从自身行动的结果中学习,这可能成为一种新的 AI 训练范式。

目前,公开研究预览版提供的是交互式环境生成功能;机器人和自主系统的应用仍需进一步开发。

世界模型的竞赛

Odyssey 由 Oliver Cameron 和 Jeff Hawke 于 2023 年创立。2026 年 6 月,该公司从包括 Amazon 和 AMD Ventures 在内的投资者那里筹集了 3.1 亿美元。

世界模型旨在让 AI 系统理解空间关系和物理关系。Google DeepMind 正通过 Genie 3 探索类似的方法,用于生成交互式世界。李飞飞创立的初创公司 World Labs 也在开发类似技术。AMD 于 9 月下旬宣布,计划以约 82 亿美元收购 World Labs。

由人工精选、摒弃炒作的 AI 新闻

订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻简报、每年六期独家「AI Radar」前沿报告、完整历史文章访问权限,以及评论区访问权限。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
n8n 显示成功,外部操作仍可能重复
下一篇
提示注入清洗中间件的设计与部署失败复盘