豆包视频通话重磅升级:火山引擎 MMT 多模态传输系统,让 AI 真正"边看边听边说"
走到陌生景点,举着手机让 AI 带你逛——它看到路牌主动提醒方向,看到建筑开口介绍典故;旁边路人聊天、街边叫卖,它不会被带偏。豆包视频通话功能完成一次系统级代际跃迁:对话节奏违和问题减少约 50%,建联耗时从秒级压缩到数百毫秒,用户几乎感受不到"等待"的存在。
走到陌生景点,举着手机让 AI 带你逛——它看到路牌主动提醒方向,看到建筑开口介绍典故;旁边路人聊天、街边叫卖,它不会被带偏。豆包视频通话功能完成一次系统级代际跃迁:对话节奏违和问题减少约 50%,建联耗时从秒级压缩到数百毫秒,用户几乎感受不到"等待"的存在。
豆包视频通话升级后,用户在连续变化的真实场景中获得了三种前所未有的交互感受。它们不是实验室指标,而是每一次拿起手机都能体验到的变化。
用户必须等 AI 说完才能开口,多轮对话节奏僵硬;AI 无法同时理解画面和声音;背景噪音容易干扰,经常答非所问。
AI 同时接收音频、视频、文本三路输入;结合口型和画面判断谁在说话;持续感知环境变化,主动提醒关键信息。
但数据只是故事的一部分。三个体验升级背后,是一次完整的技术重构。
注:官方评测基于真实用户场景,对比传统级联方案得出对话节奏违和问题减少约 50% 的结论。
这次升级是一次双线并进:模型层接入原生音视频全双工大模型 SeedRealtime,在业界率先实现音视频全双工技术的规模化落地;传输层则从传统实时通信技术(RTC)升级为火山引擎多模态传输系统(MMT)。
一个诚实的注脚:SeedRealtime 定义了"AI 能做什么",而 MMT 决定了"用户能不能真正感受到这些能力"。两者缺一不可。
MMT 的架构逻辑可以用一条链路来概括:
传统 RTC 架构下,音视频通道与信令通道分离,用户发起视频通话需要经历多轮协商——媒体通道建联、模型会话建立、状态同步各自为政,叠加下来往往需要数秒才能真正进入可用状态。MMT 通过统一的多模态会话架构,将媒体传输与模型会话深度整合,一次建联即可承载所有数据。
注:MMT 基于 QUIC 协议库和 MoQ 协议,实现媒体流与控制信令在同一会话中协同调度,省去了多通道分别建联的开销。
传统 RTC 是一条"哑管道"——机械地搬运所有数据,不管模型是否需要。MMT 则完全不同:它主动根据模型的推理状态,把"对的数据、以对的形态、在对的时机"递送到模型面前。三个核心环节完成了质的飞跃。
技术指标最终要落到用户感受上。三个典型场景,能直观说明这次升级的意义。
「走到一个陌生景点,举着手机让豆包带你逛。」——它看到路牌标识主动提醒方向,看到建筑开口介绍典故。旁边路人聊天、街边叫卖,豆包不会被带偏,依然只跟你对话。过去需要手动输入关键词查询,现在举起来就能问。
「指着航班牌问'这个怎么走',AI 看懂你指的是行李转盘。」——多模态并行输入的优势在此刻完全释放。用户不需要描述"第三行那个航班",不需要说"行李转盘在哪",指着屏幕说出来,AI 就能理解。
「多人聊天时,它结合口型和画面判断是谁在对话,不被旁边闲聊带偏。」——传统 AI 通话中,背景人声是巨大的干扰源。MMT 的多模态同步能力让 AI 可以精准分辨"谁在跟它说话",只回应目标用户。
注:以上场景基于豆包视频通话已实现的功能描述,实际体验可能因网络环境略有差异。
答案不复杂:火山引擎在做一件更长期的事——把传输基础设施从"哑管道"升级为"智能调度层",让大模型的能力近乎无损耗地传递给每一个终端用户。
当行业焦点都在讨论"谁的模型更聪明"时,豆包视频通话的这次升级揭示了一个容易被忽视的真相:AI 实时交互的竞争,不只发生在模型层。模型决定智能上限,传输决定体验下限。一个优秀的传输系统,能让模型的能力被完整地感知到;而一个落后的传输系统,会让最聪明的模型也显得笨拙。
豆包视频通话接入 SeedRealtime,是这套能力的一次完整展示。随着同传、外语陪练、博物馆讲解等场景加速落地,"边看边听边说"的实时多模态交互将成为越来越多产品的标配体验。而支撑这一切的底座,是一个经过亿级用户验证、能承载百倍复杂度的传输系统。
模型让 AI 更聪明,传输让 AI 更"真实"。当行业还在比参数时,火山引擎用 MMT 证明了一件事:实时多模态交互的体验上限由模型决定,但下限由基础设施决定。谁先建好这条"智能管道",谁就拿到了下一代 AI 交互的入场券。
豆包视频通话功能已完成升级,核心技术已全面落地。
打开豆包 App,发起视频通话,即刻感受"边看边听边说"的连续多模态交互。