字节跳动发布 SeedRealtime:音视频全双工大模型走向全模态自然交互
8 月 5 日,字节跳动正式推出原生音视频全双工大模型 SeedRealtime。该模型以统一架构融合音频、视频与文本,能在连续多模态信息流上实时交互,已在豆包 App 全量上线。

要解决什么问题
音视频实时交互此前长期受困于两种架构。
级联系统将流程拆为 ASR(语音识别)、VLM(视觉语言模型)、TTS(语音合成)多个模块串联。每个模块独立工作,处理结果传给下一个。延迟层层叠加,信息在模块间逐级损耗。视觉信息要先转成文字才能进入理解流程。
端到端模型省去了多模块串联,但不少方案仍依赖外置 VAD(语音活动检测)来判断用户什么时候说完、模型什么时候该接话。VAD 本质上做的是"检测停顿",模型等待 VAD 发出轮次信号后才回应,接近一问一答的半双工交互。
SeedRealtime 的方向是将声音、画面、时序与表达全部纳入同一个端到端模型。感知、理解、决策与表达同步进行,无需外置 VAD 判断轮次,实现真正的全双工交互。
三项核心能力
字节跳动将 SeedRealtime 的能力概括为三个维度。
音视频联合理解
模型原生融合画面、声音与时序信息。当用户说"这个怎么弄",模型结合当前画面、手势、视线与历史动作判断"这个"指向什么。遇到同音词或模糊语音时,借助视觉场景完成消歧。视觉信息无需先转成文字再理解,而是与语音在同一模型里对齐。
主动的交互能力
模型持续观察画面变化,自主判断是否需要主动介入。用户交代一句"看到某件展品就提醒我",模型便在镜头移动过程中持续留意,目标出现时出声提醒。这种主动介入不依赖用户逐步提问。
流畅的交互节奏
轮次判断由模型基于多模态信息持续决策,而非外部 VAD 规则。该接话时不迟疑,该沉默时不打断。同时具备抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发。

评测数据
端到端人工评测结果显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半。"话未说完被抢断、话音已落却回应迟缓、被背景杂音与闲聊误触发"等卡壳现象显著减少。单次对话能够顺畅、完整交流的概率也有明显提升。
字节跳动未公布具体评测样本量和详细指标数据。
真实场景演示
官方技术博客展示了 7 个具体场景。
聚餐场景:四位好友聚餐,人多话杂。模型根据外形特征把名字和人对上,认出浅色头发的七七、戴眼镜的 Julia。大家你一言我一语聊起旅行,有人想去海边、有人怕热怕累、有人对海鲜过敏,模型能分辨每句话出自谁,给出兼顾各人需求的旅行方案。

川菜馆场景:外籍食客面对中文菜单一筹莫展。模型从画面中认出菜品,用英语推荐,还能解释"为什么'鱼香肉丝'里没有鱼"、"皮蛋是怎么做的"。服务员上菜时顺道说"很下饭",模型结合画面中的菜理解这句话并翻译给客人。
博物馆场景:在河北博物院逛展,用户交代"看到错金银铜虎噬鹿屏座就提醒我",模型在镜头移动过程中留意画面,扫过那件展品时出声提醒。随后结合画面细节讲解长信宫灯等镇馆之宝。

咖啡机场景:操作复杂咖啡机时,用户把整粒咖啡豆直接倒进萃取手柄,模型指出"豆子不能直接倒进去,得先磨成细粉"。萃取结束后,模型基于对杯中油脂成色与液量的视觉解析,主动给出"下次萃取时间缩短 2-3 秒"的调整建议。
论文研读场景:研读 ResNet 论文时,模型结合网络结构图讲清跳接如何缓解梯度消失。用户说"帮我盯着,翻到训练参数那部分提醒我",模型在快速翻页过程中持续观看画面,认出"3.4 Implementation"段落并主动叫停,报出学习率、动量、权重衰减等关键配置。
机场场景:大兴机场人流密集、环境嘈杂。同伴闲聊时随口提到"老李的航班",模型未被触发。当用户正式问起,即便航班信息已从画面移出,模型仍能结合此前看到的大屏信息回答到达时间,并联网提供行李转盘位置。
学习场景:妈妈让模型陪女儿学习动物英文。背景里爸爸正在接电话、人声不断,模型没有被这段无关对话带偏,始终跟着女孩手指方向实时纠音、举例造句。
技术方向
从公开信息看,SeedRealtime 的工程实现有几个关键点:
- 连续音视频分块输入与流式生成输出:缩短端到端响应时间
- 高效量化与推理优化:提升服务效率
- 原生全双工:持续建模对话状态与时机判断,不依赖外置 VAD
字节跳动在展望中提到四个后续方向:更低的延迟与更自然的节奏,让打断、抢话、附和与停顿等微妙节奏被还原;更主动的感知与决策,主动判断何时提醒、何时补充;更稳健的多人复杂场景处理;从"能对话"到"能行动",打通工具调用与现实世界连接。
体验方式
将豆包 App 更新至最新版本,在对话框内选择"打电话",进入视频通话界面即可体验。项目主页:https://seed.bytedance.com/seedrealtime
来源:字节跳动 Seed 官方技术博客(2026 年 8 月 5 日)