🎬 多模态 · 技术突破

实时交互多模态模型 A1、W1 发布,AI 视频从「观看」进入「互动」时代

7 月 24 日,Vivix 发布两款激活参数约 30B 的实时交互多模态模型 A1 与 W1,这是全球首个集合了多模态参考、原生交互以及流式视频生成的基座模型。可见反应延迟低于 0.6 秒,端到端 TTFR 低于 1.7 秒,实时视频推理成本在一年内降低 2 个数量级,已接近主流视频平台 CDN 带宽成本量级。

综合公开信息整理 2026-07-24 全文约 3 分钟读完
#Vivix #实时交互 #多模态模型 #AI Agent #视频生成
⚡ <0.6s 可见反应延迟,实时交互
1.7s 端到端 TTFR,含网络传输
2 个数量级 实时视频推理成本降幅
注:延迟数据为实验室环境测试结果,实际体验可能因网络条件而异。成本降低基于 Vivix 官方报告,与 2024 年同类方案对比。

⚡ 30 秒速览

  • 发了什么:Vivix 发布两款 30B 参数的实时交互多模态模型 A1 和 W1,全球首个集成多模态参考、原生交互与流式视频生成的基座模型。
  • 核心指标:可见反应延迟 <0.6 秒,端到端 TTFR <1.7 秒,实时视频推理成本一年内降低两个数量级。
  • A1 做什么:让 AI 角色「边听、边说、边行动」——支持全身表演、实时全双工交互、自然情绪表达,互动中可动态加入新图片。
  • W1 做什么:将互动扩展到整个场景与故事——原生音画联合生成、多模态参考、原生多镜头叙事,用户可实时改变剧情走向。
  • 技术底座:Vivix-Turbo 超低步数蒸馏 + Vivix Infra 实时推理系统,输入处理、音视频生成、解码和推流同时运行。
  • 公司背景:2025 年初成立,已完成 A 轮融资,股东包括 IDG、红杉、蓝驰、京东、阿里等。

01核心突破 延迟与成本的双重门槛被跨越

实时交互多模态技术过去最大的瓶颈不是「能不能生成」,而是生成得够不够快、够不够便宜。Vivix 这次拿出的数据,让这两个问题有了新的答案。

<0.6s可见反应延迟
1.7s端到端 TTFR
2 个数量级推理成本降幅
~30B激活参数

注:TTFR 指首次帧反应时间,计入网络传输和直播推流。成本降低基于 Vivix 官方报告,已接近主流视频平台每小时 CDN 带宽成本量级。参数规模为约 30B。

一个诚实的注脚:这些数字是在可控环境下测得的。但即便如此,将实时视频推理成本压缩到 CDN 带宽的量级,意味着这项技术终于有了走出实验室的经济基础。

02从「会说话」到「会行动」Vivix-A1 的四个能力

Vivix 将 A1 定义为首个面向交互式 AI 角色的实时全双工模型。它要解决的问题很直接:让 AI 角色不再只是「固定画面里一张会说话的脸」。

传统 Talking Avatar

先生成语音,再让嘴型跟上。角色被限制在固定镜头前,无法走动、无法拿取物品,无法对用户中途插话做出实时反应。

Vivix-A1

角色从一张脸扩展到完整身体。能感知环境,能走动、拿取物品,完成全身表演。用户随时插话,角色随时回应,表情、声音、动作同步变化。

四个能力维度,让角色真正「活」起来

🚶

全身表演与空间移动

角色可以走动、拿取物品,完成全身表演。线上看房场景中,AI 销售能带你看房子构造,自然走出房间对外观展示,镜头跟随角色移动。

💬

实时全双工交互

即使角色正在说话或行动,用户依然可以插话、追问或更换话题,不必等它完成这一轮表演。周围环境的声音也会影响角色的反应。

😊

自然表情与情绪协同

表情、声音、手势和全身动作同步生成。角色开心、惊讶或生气时,变化落在眉毛、额头、眼神和嘴角,也反映在语气和身体姿态上。

🖼️

动态加入新素材

互动过程中可随时上传新图片。用户上传一张商品图,角色能根据新图片调整讲解,把商品带进场景并完成拿取和展示,无需重新开始生成。

03它到底能做什么?三个场景,三重能力

场景是最好的说明书。

🦊 小狐狸导览:跟着 AI 角色游景区 全身表演 + 物体交互

  • 用户跟着小狐狸游览景色,询问它接下来的计划,它会马上带你看附近的景点。
  • 小狐狸会拿着旅游地图,边走边指着身旁的风景讲解——不是提前录好的视频。
  • 用户说出的指令,会直接改变它接下来讲什么、做什么。
场景亮点:全身表演、物体交互、空间移动三项能力同步展示,全程实时响应,角色行为随用户指令动态变化。

🏠 线上看房:AI 销售带你看遍全屋 空间移动 + 镜头跟随

  • AI 销售可以带你看房子的构造,从客厅走到卧室,自然流畅。
  • 角色会自然走出房间,对外观进行展示,镜头跟随角色移动。
  • 角色不再只能面对固定镜头介绍产品,整场讲解跟着他的行动自然展开。
场景亮点:空间移动与镜头跟随的协同,角色在真实空间尺度下的行动能力,展示从「讲解」到「导览」的体验升级。

👽 外星人入侵:实时改变整个故事 W1 互动叙事

  • 用户输入「外星人入侵地球」的 Prompt,画面中依次出现太空指挥部、太空和民众视角。
  • 氛围紧张、镜头切换自然,画面、对白、环境音和音效一起生成。
  • 用户中途加入语音、图片或触控操作,后续内容从当前状态继续改变。
场景亮点:W1 的原生多镜头叙事与音画联合生成能力,故事走向由用户实时塑造,而非固定脚本。

04技术底座 为什么这些能力能同时发生

这些能力不是简单串在一起的。

常见的 AI 角色系统让语音识别、语言模型、语音合成和视频驱动依次工作。一个环节完成后,下一个才开始。链路越长,角色越难在行动过程中及时接收新的要求。

Vivix 为 A1 和 W1 设计了原生多模态生成循环——模型持续处理声音、图片和交互信息,同时生成相应的声音与画面。Director Agent 像一个实时导演,判断角色接下来要说什么、做什么,同时记住此前的对话和场景状态。

Director Agent 实时导演流式音视频生成局部连续性衔接全局序列先验稳定Vivix Infra 推流

视频采用流式生成,模型每次向前生成一小段,下一段沿着已发生的内容继续。局部连续性保证前后片段自然衔接,全局序列先验维持人物、背景和动作的长期一致。Vivix-Turbo 通过超低步数蒸馏把推理过程压缩到两步,Vivix Infra 让输入处理、音视频生成、解码和推流同时运行——用户中途改变想法,系统直接调整后续生成,已发生的内容和上下文被保留,无需从头计算。

注:技术架构示意,简化了部分中间环节。Director Agent 与流式生成的协同机制详见 Vivix 官方技术报告。

编辑核心判断

实时交互多模态的工程门槛正在被系统性攻克。AI 视频从「生成内容」走向「生成体验」,下一轮竞争的关键词将从参数规模转向交互延迟与成本控制。

现在就能用

A1 与 W1 已通过 Vivix API 平台开放,开发者可申请接入。实时交互体验正在从实验室走向真实世界。

Vivix 官网 → 申请体验

面向开发者与企业用户,个人体验入口后续开放。