🎯 模型 · 技术升级

豆包视频通话重磅升级:火山引擎 MMT 多模态传输系统,让 AI 真正"边看边听边说"

走到陌生景点,举着手机让 AI 带你逛——它看到路牌主动提醒方向,看到建筑开口介绍典故;旁边路人聊天、街边叫卖,它不会被带偏。豆包视频通话功能完成一次系统级代际跃迁:对话节奏违和问题减少约 50%,建联耗时从秒级压缩到数百毫秒,用户几乎感受不到"等待"的存在。

综合公开信息整理 2026-07-24 全文约 3 分钟读完
#豆包 #火山引擎 MMT #SeedRealtime #多模态传输 #AI 实时交互
3 大体验升级 边看边听边说 · AI 主动开口 · 对话节奏自然
50% 对话节奏违和问题减少
数百毫秒 建联耗时,从秒级压缩至此

⚡ 30 秒速览

  • 核心变化:豆包视频通话升级为"边看边听边说"的连续多模态交互,用户不用等 AI 说完再开口,AI 能同时处理音频、视频、文本三路输入。
  • 三个直观感受:多模态并行输入(指着航班牌问"这个怎么走",AI 看懂是指行李转盘);AI 主动开口(看到关键标识主动提醒);对话节奏自然(不打断也不冷场)。
  • 技术双线升级:模型层接入原生音视频全双工大模型 SeedRealtime;传输层从传统 RTC 升级为火山引擎多模态传输系统(MMT),实现代际跃迁。
  • MMT 三大核心:秒接通(建联耗时数百毫秒)、零丢字(多模态会话同步,从源头杜绝答非所问)、精准意图理解(传输层变成智能调度层)。
  • 深层信号:AI 实时交互的竞争已不只发生在模型层——传输基础设施正在从"哑管道"升级为"智能调度层",决定体验的下限。

01三大体验升级 用户能直接感知的变化

豆包视频通话升级后,用户在连续变化的真实场景中获得了三种前所未有的交互感受。它们不是实验室指标,而是每一次拿起手机都能体验到的变化。

升级前:传统 AI 通话

用户必须等 AI 说完才能开口,多轮对话节奏僵硬;AI 无法同时理解画面和声音;背景噪音容易干扰,经常答非所问。

升级后:豆包视频通话

AI 同时接收音频、视频、文本三路输入;结合口型和画面判断谁在说话;持续感知环境变化,主动提醒关键信息。

但数据只是故事的一部分。三个体验升级背后,是一次完整的技术重构。

3路并行输入
50%违和感降低
主动感知环境
自然接话停顿

注:官方评测基于真实用户场景,对比传统级联方案得出对话节奏违和问题减少约 50% 的结论。

02技术底座:从 RTC 到 MMT 的代际跃迁

这次升级是一次双线并进:模型层接入原生音视频全双工大模型 SeedRealtime,在业界率先实现音视频全双工技术的规模化落地;传输层则从传统实时通信技术(RTC)升级为火山引擎多模态传输系统(MMT)

一个诚实的注脚:SeedRealtime 定义了"AI 能做什么",而 MMT 决定了"用户能不能真正感受到这些能力"。两者缺一不可。

MMT 的架构逻辑可以用一条链路来概括:

统一多模态会话 QUIC 客户端建联 MoQ 信令控制 MediaKit 同源处理 智能调度层

传统 RTC 架构下,音视频通道与信令通道分离,用户发起视频通话需要经历多轮协商——媒体通道建联、模型会话建立、状态同步各自为政,叠加下来往往需要数秒才能真正进入可用状态。MMT 通过统一的多模态会话架构,将媒体传输与模型会话深度整合,一次建联即可承载所有数据

注:MMT 基于 QUIC 协议库和 MoQ 协议,实现媒体流与控制信令在同一会话中协同调度,省去了多通道分别建联的开销。

03MMT 三大核心能力 传输系统第一次"理解"模型需要什么

传统 RTC 是一条"哑管道"——机械地搬运所有数据,不管模型是否需要。MMT 则完全不同:它主动根据模型的推理状态,把"对的数据、以对的形态、在对的时机"递送到模型面前。三个核心环节完成了质的飞跃。

⚡ 秒接通,秒应答 建联数百毫秒

  • 客户端底层基于 QUIC 库,复用连接、多路复用,一次建联即可承载音视频、信令、模型状态等多路数据。
  • 传输层基于 MoQ 协议实现统一会话控制,媒体流与控制信令在同一会话中协同调度,省去多通道分别建联的开销。
  • 结果:用户点开视频通话几乎"秒接通",对话感的连贯性大幅提升。
传统 RTC 需要数秒,MMT 压缩至数百毫秒

🔇 零丢字,从源头杜绝答非所问 多模态会话同步

  • 音视频流与模型会话状态在同一传输链路中统一调度,不再是"两条各跑各的管道"。
  • 网关层引入 MediaKit 同源处理算法,实时判断首帧是否完整、音画是否对齐、模型是否就绪——只有所有模态状态同步后,才会触发模型推理
  • 结果:从源头上杜绝了"丢字"和"答非所问",用户刚开口说"帮我看看这道题",模型不会只收到"这道题"。
延迟抖动超过 1 秒就会导致模型接收信息变形的老问题,在 MMT 的精细会话控制下得到系统性改善。

🎯 精准意图理解,智能推理应答 C/S 智能调度

  • C/S 架构设计让传输从"哑管道"变成了"智能调度层":服务侧网关承担关键决策角色。
  • 用户打开摄像头,网关判断是否需要抽帧、是否需要高清图、是否要结合模型反馈改变处理策略。
  • 分层会话控制精细调度:哪一路音频优先、哪一帧视频更值得送给模型、哪些内容需要可靠传输,都由 MoQ 信令上的逻辑单元决定。
  • 结果:语音、画面、时序信息在传输层就完成对齐,模型拿到的是"打包好的、同步的"多模态输入。
MMT 不是被动地等 SeedRealtime 来"取"数据,而是主动根据模型推理状态,把"对的数据、以对的形态、在对的时机"递送过去。

04这些能力在真实场景里意味着什么

技术指标最终要落到用户感受上。三个典型场景,能直观说明这次升级的意义。

📍

景点导览:AI 比导游更"懂"你

「走到一个陌生景点,举着手机让豆包带你逛。」——它看到路牌标识主动提醒方向,看到建筑开口介绍典故。旁边路人聊天、街边叫卖,豆包不会被带偏,依然只跟你对话。过去需要手动输入关键词查询,现在举起来就能问

🛫

机场问询:指着屏幕说"这个怎么走"

「指着航班牌问'这个怎么走',AI 看懂你指的是行李转盘。」——多模态并行输入的优势在此刻完全释放。用户不需要描述"第三行那个航班",不需要说"行李转盘在哪",指着屏幕说出来,AI 就能理解

👥

多人对话:AI 知道你在跟谁说话

「多人聊天时,它结合口型和画面判断是谁在对话,不被旁边闲聊带偏。」——传统 AI 通话中,背景人声是巨大的干扰源。MMT 的多模态同步能力让 AI 可以精准分辨"谁在跟它说话",只回应目标用户。

注:以上场景基于豆包视频通话已实现的功能描述,实际体验可能因网络环境略有差异。

05为什么是火山引擎做出来了?

答案不复杂:火山引擎在做一件更长期的事——把传输基础设施从"哑管道"升级为"智能调度层",让大模型的能力近乎无损耗地传递给每一个终端用户。

当行业焦点都在讨论"谁的模型更聪明"时,豆包视频通话的这次升级揭示了一个容易被忽视的真相:AI 实时交互的竞争,不只发生在模型层。模型决定智能上限,传输决定体验下限。一个优秀的传输系统,能让模型的能力被完整地感知到;而一个落后的传输系统,会让最聪明的模型也显得笨拙。

豆包视频通话接入 SeedRealtime,是这套能力的一次完整展示。随着同传、外语陪练、博物馆讲解等场景加速落地,"边看边听边说"的实时多模态交互将成为越来越多产品的标配体验。而支撑这一切的底座,是一个经过亿级用户验证、能承载百倍复杂度的传输系统。

编辑核心判断

模型让 AI 更聪明,传输让 AI 更"真实"。当行业还在比参数时,火山引擎用 MMT 证明了一件事:实时多模态交互的体验上限由模型决定,但下限由基础设施决定。谁先建好这条"智能管道",谁就拿到了下一代 AI 交互的入场券。

现在就能体验

豆包视频通话功能已完成升级,核心技术已全面落地。
打开豆包 App,发起视频通话,即刻感受"边看边听边说"的连续多模态交互。

打开豆包 App → 发起视频通话