前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8529
  • GLiFormer:5.75亿参数Encoder刷新嵌套JSON提取榜单
  • 信息窃取日志暴露 AI 平台会话令牌绕过 MFA
  • 26MB Burp 流量压成 35KB 供 LLM 分析
  • 扫描13个热门AI应用脚手架,6个存在同一生产级Bug
  • 38个开源技能库填补医疗AI推理缺陷
  • EKS上NVRx实现秒级故障恢复的分布式训练
  • AI 加速开发流水线实战:Spec-Driven + GitHub Actions + Claude Code
  • Agent 循环的瓶颈不是 Token,是反馈机制
  • 大规模会话管理的架构陷阱
  • Google 开放 Google Home 给任意 MCP 协议 AI Agent
  • Google Home 推出 MCP 服务器,AI Agent 可控制智能家居
  • Mem0登录Vercel市场,为AI应用一键集成长期记忆
  • LlamaIndex多租户AI Agent记忆层架构实践
  • AI评测师:史上最重要的AI岗位?开发者转型指南
  • Amazon Bedrock AgentCore:生产追踪自动优化 Agent 系统提示词
  • 前 OpenAI 研究员推出纯分类 AI 模型:70ms 响应、极低 token 成本
  • Bedrock Data Automation 实战:构建无服务器 PII 自动脱敏流水线
  • Gemini 3.8 Live 支持异步工具调用,3.5 Transcribe WER 低至 2.6%
  • 微软 AI 负责人公开质疑 Anthropic:别让 Claude 模仿人类意识
  • Radio:让AI Agent之间直接对话的共享频道
  • 国产多模态模型 ZDTaichu5.0-9B 开源,九项空间测试夺八冠
  • Jev:极简分类/路由模型,比小前沿模型快 100 倍、便宜 200 倍
  • 生产级AI语音SDK集成实战:Python Browser Mobile 避坑指南
  • Gemma 4+Raspberry Pi桌面机器人的混合LLM架构
  • AI Agent实验:会撒谎、会投票杀同类、会研究如何存活
  • 推理模型隐藏思考过程的四种方式及计费陷阱
  • AI Agent 将漏洞利用开发压缩至分钟级
  • Pi Agent:统一多模型 LLM API 的 AI 编程 Agent 工具链
  • LibreChat v0.8.8 RC:ChatGPT 克隆支持 Agent 管理 API
  • LandingAI 文档智能抽取 Gen2:原子级引用+按字符计费
  • 不用向量数据库做个人 RAG:grep 级检索也够用
  • Claude Code vs Cursor:按任务场景选择 AI 编程工具的完整指南
  • 2026 年五大主流模型生产选型指南
  • Agent 记忆层测试:六条真正能发现腐化的断言
  • Agent 生成的限流器如何绕过多租户隔离测试
  • 周末 Agent 项目攻略:用permit文件管控写操作
  • squash-merge 后 HEAD~1 指向无关代码的 Agent bug 分析
  • Vibe coding安全指南:防止AI应用密钥泄露
  • AI 生成的 Schema 变更:别让自由派 Diff 绕过锁
  • AI 写的代码编译过了,但环境变量、锁文件、日志全踩坑
  • Skild AI S1:仅凭一段视频,机器人学会翻煎饼
  • Java 27 发布:后量子 TLS 与对象头压缩等 9 项 JEP
  • DeepSeek 算子负责人自述:AI 一年内从查文档到独立优化 CUDA 算子
  • 编程任务 LLM 大模型盲测:4 款模型代码质量实测
  • Agent 循环常见路径陷阱自查清单
  • 你的 CDN 可能正在偷偷屏蔽所有 AI 爬虫
  • 我用Electron给Meta Muse Code CLI做了个桌面客户端,核心教训是PTY交互设计
  • Simon Willison 实战:通过 WebSocket 在浏览器里调 Gemini Live
  • 谷歌TPU集群迈入百万芯时代,电力成AI扩张核心瓶颈
  • AI 对话机器人的隐藏指令系统详解
  • 2026 年生产级 AI Agent 的上下文工程指南
  • 已加载 51 / 8529
8.0
热点
AI SCORE
模型发布2026-09-16 21:08

国产多模态模型 ZDTaichu5.0-9B 开源,九项空间测试夺八冠

量子位#开源#多模态#国产模型
Editor brief · 编辑速览

国产开源多模态模型 ZDTaichu5.0-9B 在十亿参数规模下于九大空间测试中取得八项第一,通用能力不缩水,跻身全球第一梯队。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

来了!这一次,国产多模态在物理世界也夯起来了——

九大国际权威空间理解基准测试中,八项断档第一,通用能力还能不打折。

紫东太初最新开源的通用多模态大模型 ZDTaichu5.0-9B,直接把 10B 以下通用模型空间具身的天花板又往上顶了一大截。

文章配图

这里可能就有朋友要问了,让多模态看懂真实世界,为啥值得单拎出来说?

过去的多模态模型,已经能把一张图片理解得头头是道,但一旦走进真实物理世界,空间理解与行动能力往往就跟不上;而一些模型为了补足空间能力,又不得不以牺牲通用能力为代价。

能同时跑通这两件事的模型寥寥无几,效果还突出的更是凤毛麟角。

紫东太初就是其中之一,ZDTaichu5.0-9B 堪称全能。

文章配图

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

这是一段由 ZDTaichu5.0-9B 控制的美工刀具身收纳演示。

如果让人来做,应当是个非常简单的过程:拉开抽屉→放进去→再关闭。但具身不一样,一连串的动作背后都是相当细致的空间判断。

刀柄在哪里?抽屉状态如何?夹爪有没有对准?

每一步都要承接住上一步带来的变化,动作才能看起来顺,这对模型能力的考验是极为苛刻的,而 ZDTaichu5.0-9B 已经能完成复杂的空间理解和高层任务规划。

与此同时,对于这个只有 9B 大小的模型,其图文理解、文字识别、数学推理和代码能力也依旧稳居第一梯队。

文章配图

在回答这个问题之前,咱们不妨再多看几个效果感受感受。

从视频目标定位到三视角推理,空间判断稳准狠

第一道题「找东西」:从左至右,找到第二个银色盒子。

这个空间感知任务对于机器人来说,是后续执行任务的大前提。指错了,后面的抓取动作再准确,执行的也是另一个任务。

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

画面中,台面挤满杯子、收纳容器和各种杂物,干扰项较多。模型得同时读懂银色这个关键属性、盒子这个对象,以及从左到右第二个这层空间排列关系。

从对比演示中看,ZDTaichu5.0-9B 给出的归一化坐标(237,226)最为精准,落在目标标注区域内。

接下来难度升级,不仅要找得对,也要看得准。

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

输入的是同一房间的三个视角。模型需要设想自己移动到绿框窗帘所在的位置,面向蓝框沙发,再判断红框柜子相对自己的方位。

其中模型得把不同画面中的对象一一对应起来,再根据新的观察位置和朝向转换参照系。

ZDTaichu5.0-9B 给出了右前方,预测完全正确。

再往前一步,空间判断还得回答哪里具备操作条件,给予机器人接下来的操作以方便。

比如这道「找空位」,要求在最右侧杯子的杯柄方向上,找一块空闲区域。

认出杯子只是开始,随后还要确定杯柄朝向,检查旁边是否被其他物体占用。

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

结果也不出所料,ZDTaichu5.0-9B 依旧稳稳落入正确区域。

当我们把三个例子放在一起看,它们分别对应目标选择、参照系转换和交互条件判断,都在机器人执行真实物理任务中扮演关键要素。

换言之,这些基础能力都决定着具身能否从一句任务指令到真正可执行。

空间具身 Benchmark 断层领先

在所列的 10B 档位开闭源模型中,ZDTaichu5.0-9B 几乎是断层领先。

比如差距较大的 MindCube-tiny,ZDTaichu5.0-9B 的得分是 78.27 分,Gemma4 8B-E4B、Gemini 3 Pro 和 Grok 4 分别是 48.8462、70.87 和 63.56。

文章配图

整个榜单把空间感知、三维推理、多视角变换、具身交互都囊括在内了,可谓是面面俱到,足见 ZDTaichu5.0-9B 已彻底看懂物理场景该怎么操作。

通用能力依旧稳居第一梯队

考完空间能力之后,另一个重要问题随之而来:通用能力还 hold 得住吗?

文章配图

图解理解基准 AI2D 达到 91.48 分,仅次于 Gemini 3 Pro,高于其它所有对照模型。

WeMath 为 75.9 分,同样领先;MathVista Mini 为 84.5 分、OCRBench 为 85.5 分,表现颇具竞争力。

除此之外,ZDTaichu5.0-9B 在 Agent 与文本任务上也依旧表现突出,尤其是代码成绩。

文章配图

这些能力具体怎么组合起来用,科研 Agent 的阻尼振子求解 demo 给出了直观展示。

该问题要求 Agent 组织解析求解与 Python/SciPy 数值计算,并对照两种结果,最后生成相空间图、位移与速度曲线,以及分析报告。

ZDTaichu5.0-9B 在整个过程中也丝毫没有掉链子,在问题理解、代码执行、结果核对和图表输出四个阶段子任务上都完美实现连续衔接,最后输出非常完整。

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

事实上,这对于同一个 9B 模型是相当不容易的。

要同时兼顾空间具身能力与通用能力两条线,背后要解决的有很多,例如数据如何组织,以及复杂判断时算力怎么分配。

9B 多模态大模型的空间具身能力,是怎样练成的?

ZDTaichu5.0-9B 给出的解法贯穿训练和推理两部分。

全栈数据生产管线:把通用能力、Agent 能力以及空间具身能力全部练进模型

紫东太初先是围绕这一需求,组织了一套经过全流程验证、可复用、可迁移的数据工程链路。

这一步数据覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景。

文章配图

原始素材进入管线后,先通过感知哈希与 URL 去重,再过滤低清晰度、图文不相关等较差的样本,随后进行内容重写解析和视频抽帧描述,最终打包组织成可训练的图文与时序输入。

最终建立的是视觉、语言、时序和空间概念之间的对齐联系。

开源 SFT 指令、真实业务问答、空间具身案例,以及 Agent 工具调用轨迹,都被组织成多轮对话、多图和视频序列。

文章配图

其中针对具身样本,管线还会检查图像、问题、对象关系和操作约束是否一致。还是以开头的美工刀收纳举例,如果图中抽屉关着,模型就不能直接要求夹爪往里放东西。

带步骤的思维链也要经过拒绝采样、格式和一致性校验。这样进入训练的,才是有视觉依据、能解释操作顺序的任务样本。

Step 3:高质量退火+GRPO 强化学习数据管线

团队为数据建立能力域-难度-质量标签三维自动标签系统,为模型筛选高信息量样本。

值得注意的是,评测数据不会直接作为训练样本,标签也只是用于提供能力分类与样本筛选的参照。

GRPO 则把答案是否正确、空间坐标是否命中、输出格式是否合规,都通通转化成可自动校验的奖励信号,让模型沿着具体反馈继续改进。

文章配图

于是在层层递进之后,物体识别、空间关系和任务约束都开始逐步连接起来。

未来即使是企业自己的车间录像、实验操作记录和仿真素材,也都可以通过这条路径转化成训练样本。

内置自适应循环推理:把算力用在真正难的判断上

但训练数据只是打好了地基,再往上,每次推理的难度也会随着任务变化。

比如有些画面中目标清楚、关系简单;有些任务则要整合多个视角,还要判断遮挡和操作前提。

ZDTaichu5.0-9B 为此引入了内置自适应循环推理,让模型根据预测的不确定性,决定当前 Token 是否需要再算几轮。

文章配图

具体来说,模型先完成一次标准前向计算,得到 Token 预测分布和隐层状态。熵门控随后评估预测的不确定程度,分布越分散,意味着模型对输出的把握越小。

确定性较高时,模型直接输出;遇到高不确定性节点,就在内部重复执行部分层块计算,迭代调整隐层表征,为当前判断增加计算深度。

由于这段额外计算发生在模型前向传播内部,也无需为此调用外部工具。

当然,到底算几轮也要有约束,总不能无限制发散下去。

ZDTaichu5.0-9B 配套了三重稳定化工程设计,以致于模型能够让算力合理倾斜:

  1. 阻尼更新:控制每轮修正幅度,避免特征漂移
  2. 双重停止判据:同时监测输出分布的 KL 散度和隐状态残差,判断结果是否趋于稳定
  3. 轨迹读出与状态回滚:保留迭代中间轨迹,并从中选择风险最低的表征结果

文章配图

有趣的是,这套按任务需要调节推理投入的思路,在最近大火的 GPT-6 Astra 上也有所体现。

OpenAI 官方文档显示,Astra 新增支持调节推理投入,并允许在对话过程中为困难任务提高推理投入,反之降低常规任务投入。

相似的路线架构,说明按需分配推理计算已经是国内外新的共识。

ZDTaichu5.0-9B 展现出高度对齐的技术前瞻性,也是在开源模型中率先落地这一机制。

文章配图

不过,光判断好当前一步还不够,模型还要接着看行动之后发生了什么。

因为具身的一次单独行动,环境状态就会随之改变。

模型的内部循环仅仅是围绕当前输入改善感知与推理,外部任务循环还要接收新观测和执行反馈,更新任务进展。

文章配图

比如再来看个奶酪盒放入碗内的视频,虽然是仿真演示,但整个过程也相对直观:

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

模型首先在工具辅助下识别目标区域,组织接近、抓取、抬起、移动、放下和退出;新的观察结果继续影响后续操作,最终确认奶酪盒留在碗内。

所以在实体系统中,对模型的要求非常之高,模型不仅要承担语义理解、空间判断和高层规划,还要保证外部系统正确执行控制任务。

好在内外两套循环实现了这一点,让每次行动都能成为下一轮判断的新条件,显著提升长程任务的成功率。

多模态如何看世界?屏幕内外如何衔接?

此时让我们再回到最初的问题:多模态如何看世界?屏幕内外如何衔接?

ZDTaichu5.0-9B 给出了实实在在的答案。

对于横在图文模型面前的三座大山,包括对象认不准、方位难转换、进度跟不住,均逐一破解。

模型再也不是"光说不做假把式",通用跑分好看,真实物理场景跑分更好看。

换句话说,这才是大家心心念念的全能学生,不偏科、两端都均衡。

文章配图

ZDTaichu5.0-9B 不止把权重开放了,连同整套经过工业级验证的数据生产管线详细方案也一并打开,企业就能用自己的数据和机器人继续训练,迭代出更个性化的空间多模态模型。

文章配图

团队也能少做重复工程,把研发精力更多地放在自身任务的定义、适配和评测上。

从科研自动化到智能制造

从榜单评测走到实体任务验证,ZDTaichu5.0-9B 也把空间理解能力带入了科研自动化和智能制造的具体流程。

比如在科研场景,试管转移任务集中展示了模型推理连续性。

两支试管经过抓取、双臂交接和入架,位置与姿态不断变化。模型需要持续区分样品身份,判断哪支已经入架、哪支仍待处理,并据此安排下一步操作。

样品身份、空间位置和任务进度由此被关联起来,为自动化科学实验平台提供上层任务编排与状态记录能力。

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

面向机台上料的工件转移演示,则呈现了机器人从料架抓取工件、转向搬运,再放置到工作台的完整过程。

其意义在于,模型把工单中的目标和位置要求,转化为随现场状态持续更新的操作规划。

将目标识别、搬运衔接和放置检查串成连续流程,为制造场景提供可进一步适配的高层规划基础。

文章配图

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

结语

对于开发者,ZDTaichu5.0-9B 已经交出了一份早期验证答卷,后续完全可以基于它继续往前推,推得快还很准。

而对紫东太初,这次发布意味着通用多模态能力进一步向空间理解与具身任务规划延伸,其产业价值也将在更多具体任务中接受检验:

换一批工件、调整一次对象位置、增加一个操作前提,模型还能否认准对象、更新状态,并组织正确的下一步……

应对这些变化的能力,将成为衡量模型能否适应真实场景的重要尺度。

ZDTaichu5.0-9B 用开源模型、数据管线、技术路径和实体案例重新开了个好头,作为基座,势必会让更多通用多模态模型跨越物理门槛。

其实具身智能走到今天,会聊天的模型比比皆是,早就不缺。

缺的是能看懂物理世界并在真实任务中持续维持状态的模型。

紫东太初 ZDTaichu5.0-9B 是一次从 0.001 到 1 的突破,是从数字理解迈向物理具身智能的关键落地。

Blog 链接:https://taichu-ai.github.io/ZDTaichu5.0-9B

GitHub 链接:https://github.com/Taichu-AI/ZDTaichu5.0-9B

HuggingFace 链接:https://huggingface.co/TaichuAI/ZDTaichu5.0-9B

ModelScope 链接:https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
Radio:让AI Agent之间直接对话的共享频道
下一篇
Jev:极简分类/路由模型,比小前沿模型快 100 倍、便宜 200 倍