SeedRealtime将音频、视频、文本融合到统一架构,实现实时全双工交互,被视为迈向全模态交互的重要一步。
ByteDance 的 Seed 团队推出了 SeedRealtime,一款原生音视频全双工 LLM。该模型将音频、视频和文本融合在单一统一架构中,通过连续多模态流进行实时交互,而非逐轮交互。Seed 将其定位为迈向全模态交互的一步,并声称实现了三大突破:音视频联合理解、主动交互和自然的对话节奏。架构层面的目标是解决级联问题:链式 ASR、VLM 和 TTS 模块会增加延迟并在各阶段之间丢失信息。SeedRealtime 则在同一个端到端模型内并行运行感知、理解、决策和表达。话轮切换也移至模型内部,取代了大多数实时语音系统仍依赖的外部语音活动检测器(VAD)。
它支持部分部署。
SeedRealtime 已上线于 Doubao 应用(字节跳动的消费级助手)。对于这个特定模型,ByteDance 未发布技术报告、参数规模、开放权重,也未公布 Volcano Engine 或 BytePlus 的 API 端点。作为第三方团队,你目前无法将其集成。当前可以部署的是这个思路:一个经过验证的参考架构,以及为所有实时语音加摄像头产品移动了的目标线。
交互式解读
演示中真正新在哪
Seed 发布了七个场景,其中四个是核心负载。
跨模态身份绑定:在一个嘈杂的聚餐场合,模型在人们互相介绍时将姓名与面孔匹配,随后将每个人的声音与其身份关联——在提出旅行计划前,先将相互冲突的旅行偏好正确归属给对应的说话者。
从一条挂起的指令中主动发声:在河北博物馆,用户请求在特定的青铜座屏出现时提醒自己。摄像头持续平移;模型在藏品进入画面时主动开口提示。同样的行为也出现在 ResNet 论文演示中——模型追踪快速翻页,识别到"3.4 实现"章节后自行暂停,并朗读出学习率、动量和权重衰减。
从视觉状态而非问题中进行纠正:观看浓缩咖啡制作流程时,模型在整豆被放入粉仓时打断,随后读取咖啡油脂的颜色和体积,并建议将萃取时间缩短 2 到 3 秒。
干扰抑制与屏外记忆:在北京大兴机场,无关的航班闲聊不会触发回复。当用户真正提问时,模型从已经滚出屏幕的离港信息牌中提取答案,并联网查询行李转盘位置。
SeedRealtime 是一款原生音视频全双工 LLM——音频、视频和文本在单一端到端架构中合一。
话轮切换移至模型内部;无需外部 VAD 决定何时说话。
ByteDance 自研的人类评估报告显示,与级联系统相比,对话节奏问题减少了一半——但没有基准测试数据,也没有延迟数字。
它已上线于 Doubao 应用,但没有技术报告、没有权重、也没有公布 API。
查看 ByteDance Seed 发布帖和 Seed 模型页面。也欢迎关注我们的 Twitter,别忘了加入我们的 15 万+ ML SubReddit 并订阅我们的Newsletter。等一下!你用 Telegram 吗?现在你也可以加入我们了。
想要与我们合作推广你的 GitHub Repo 或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。在统计分析、机器学习和数据工程方面有坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。