SeedRealtime 能联合理解音频、视觉和时序信息,实现「观看、倾听、说话」一体化的实时交互体验。
今天,我们正式发布 SeedRealtime,一款原生的音视频全双工 LLM。
作为迈向全模态交互的关键一步,SeedRealtime 采用统一架构原生融合音频、视频和文本,支持在连续多模态流上进行实时交互,带来全新的"观看、倾听与对话"体验。它实现了三个核心突破:
音视频联合理解:原生支持音频、视觉和时间信息的深度融合。模型能够借助视觉上下文消除同音词歧义,能够准确解读所见内容中的时间指代,将所见、所闻与所言统一起来。
主动交互:持续感知环境并具备主动发言能力。当它注意到视觉上的变化(如关键目标出现)时,模型可以主动发出提醒;它还能将工具调用融入回复中,使交互从被动响应转变为主动协作。
自然的对话节奏:模型实时感知用户的对话状态和节奏,在恰当的时机插话、停顿和回应。它还具备极强的抗干扰能力,能够区分旁观者的交谈和背景噪音,不会被误触发,保持对话流畅连贯。
端到端人类评估表明,与级联模型相比,SeedRealtime 将音视频对话节奏问题减少了一半:模型判断何时发言变得更加自然,显著减少了各种尴尬的中断(如话说到一半被打断、停顿后迟缓回应、或被背景噪音和闲聊误触发)。同时,一次性顺畅完整地完成对话的概率也大幅提升。
目前,SeedRealtime 已全面上线,在行业内率先实现音视频全双工技术的大规模部署。
实时音视频交互长期以来一直困于两种范式之间。级联系统将 ASR、VLM、TTS 等独立模块串联在一起,在各阶段之间引入延迟和信息损失。端到端模型更加流畅,但许多方法仍然依赖外部 VAD 来判断话轮转换,本质上仍然是一种半双工的一问一答式交互。
SeedRealtime 的核心突破在于将声音、视觉、时序和表达统一在一个端到端模型中。它不需要先听完、再看完、最后再回答,而是让感知、理解、决策和表达在连续音视频流上并行运行,使所听到的和所看到的共同驱动每一个实时判断。
第一个挑战是对话节奏。语音天然包含停顿,这些停顿有助于指示何时该回应。而视频则始终在线并持续变化。模型必须持续理解屏幕上的发生的事情,同时不能因为背景噪音就过于频繁地插话;它需要不断决定关注哪个对象、倾听谁的声音、以及此刻是否应该回应。
更深的挑战在于音视频联合建模和时间对齐。当用户说"这个怎么做"时,模型必须结合当前场景、手势、目光和先前动作来确定"这个"指的是什么;当遇到同音词或不清楚的语音时,它也需要借助视觉场景来消歧。只有将声音、视觉和时间信息共同建模,模型才能真正将所见、所闻与所言联系起来。一旦将观看、倾听和发言纳入同一个实时决策系统,模型就不再只是等待问题,而是能够持续追踪场景变化并在恰当时机主动发言。
接下来,让我们通过七个具体案例来看看 SeedRealtime 在实际场景中的表现。
SeedRealtime 能够在拥挤、嘈杂、开放的现实环境中对齐并联合理解视觉、音频和时间信息。
四位朋友正在聚餐:人来人往、交谈声此起彼伏。当用户逐一介绍在场众人时,SeedRealtime 根据外貌将名字与人脸匹配,认出了浅色头发的 Qiqi 和戴眼镜的 Julia,甚至主动和 Lele 打招呼。在后续对话中,它始终将每个人的声音与其身份对应起来。
随后大家开始轮流谈论旅行:有人想在海滩拍照、参观水族馆,有人怕热怕麻烦,还有人对海鲜过敏。SeedRealtime 能分辨出每句话来自谁,并根据大家的对话提供一份兼顾每个人需求的旅行计划。识别人物、分辨声音、理解每个人需求,这些都由同一个模型在同一次对话中实时处理。
在一家川菜馆,一位外国食客被全中文菜单难住了。SeedRealtime 直接从场景中识别菜品,用英文推荐,甚至还借助文化背景解释"鱼香肉丝为什么没有鱼"以及"皮蛋的制作方法"。
当服务员端上一道菜随口说"这个配米饭特别好吃"时,模型结合屏幕上的菜品理解这句话,并为客人翻译。视觉信息不需要先转成文字;它在同一个模型内与语音对齐,因此模型能够根据眼前所见来回答。
模型根据直播场景的持续变化自主决定是否需要介入,而不是每次都等待用户先开口。
在河北博物馆参观展览时,用户说"你看到金银嵌青铜虎噬鹿屏风座时提醒我一下"。随着相机不断移动,SeedRealtime 持续观察场景,当画面扫过那件展品时,它主动开口提醒。
随后它借助视觉细节讲解金银嵌青铜方形桌座(四龙四凤)、长信宫灯等珍宝,以及铸造、金银嵌、焊接等工艺。将任务记在心中并在目标出现时立即提醒,正是持续视觉感知和主动交互的体现。
在操作一台复杂的意式咖啡机时,模型能够根据视觉状态的变化实时纠正错误并给出反馈。
当它看到用户直接将整颗咖啡豆倒入 portafilter 时,模型立刻指出:"不能直接倒豆子进去,需要先研磨成细粉。"萃取完成后,根据对 crema 颜色和杯中液体量的视觉判断,它主动建议"下次萃取时间缩短 2 到 3 秒"。不需要用户一步一步地问,模型就能根据实际情况发表意见。
在研读 ResNet 论文时,模型利用网络结构图讲解 skip connections 如何缓解梯度消失问题。当用户说"帮我盯着,翻到训练参数部分时提醒我",它持续关注屏幕翻页,精准定位到"3.4 Implementation"部分,并主动停下来,然后朗读学习率、momentum、weight decay 等关键训练设置。在连续帧流中定位目标并主动停下来,展示了真正的主动协作式交互。
话轮转换不再交给外部 VAD 规则处理;SeedRealtime 根据多模态信息持续判断,该插话时毫不犹豫,该安静时绝不打扰,即使在复杂环境中也能保持更自然的节奏。
北京大兴机场人声鼎沸、嘈杂喧闹。当同伴在闲聊中随口提到"老李的航班"时,模型不会被这句无关的话触发回应。当用户真正问及时,尽管航班信息已经从屏幕上消失,它仍能根据先前看到的出发牌信息给出实时到达时间,并上网查询行李转盘位置。
随后两人边走边聊,模型持续观察前方的场景,当看到网约车标识时,它自然地插话指引上车点位置。嘈杂的环境不再只是需要过滤掉的干扰;闲聊中的关键信息也能被妥善保留并在需要时加以利用。
妈妈忙着别的事,请 SeedRealtime 帮忙教女儿学动物英文名。背景中爸爸在打电话,声音不断,但模型不会被这些无关对话带跑,始终跟随女孩的指向,实时纠正她的发音并举例造句。模型该说话时不犹豫,有干扰时不跑偏。
SeedRealtime 的发布标志着音视频交互的关键一步。通过在统一架构内原生融合音频、视频和文本,模型能够持续理解场景、判断节奏、跨多模态流进行响应。由此,"观看、倾听与对话"真正成为日常交互体验。
然而,现实世界的音视频交流是复杂而连续的:背景嘈杂、声音重叠、场景变化,用户随时可能停顿、补充或打断。为了应对这些现实挑战,我们将在多个方向上持续推进:
更低的延迟与更自然的对话节奏:持续压缩端到端"听到、理解、回应"的延迟,使打断、插话、反馈式应答、停顿等真实对话中的微妙节奏得以自然重现,不仅更快,而且时机更准。
更主动的感知与决策:在持续理解视觉和声音的基础上,主动判断何时该提醒、何时该补充信息、何时将用户恰好需要的信息递过去,使模型不仅"该说时说",还能"该做时做"。
在复杂多人场景中更强的鲁棒性:在嘈杂环境、多人入镜、多方对话的情况下,可靠地识别谁在说话、他们在看什么、应该回应谁,将这些能力带入更多现实生活和工作场景。
从"能对话"到"能行动":将工具调用与现实世界连接起来,使模型不仅能交流和观察,还能帮助用户完成查询、预订和任务,将实时多模态理解转化为具体行动。
我们希望 AI 交互不再局限于回合制的一问一答,而是在持续变化的现实场景中理解上下文,敏锐把握时机,在恰当的时刻提供帮助。