实时交互多模态模型 A1、W1 发布,AI 视频从「观看」进入「互动」时代
7 月 24 日,Vivix 发布两款激活参数约 30B 的实时交互多模态模型 A1 与 W1,这是全球首个集合了多模态参考、原生交互以及流式视频生成的基座模型。可见反应延迟低于 0.6 秒,端到端 TTFR 低于 1.7 秒,实时视频推理成本在一年内降低 2 个数量级,已接近主流视频平台 CDN 带宽成本量级。
7 月 24 日,Vivix 发布两款激活参数约 30B 的实时交互多模态模型 A1 与 W1,这是全球首个集合了多模态参考、原生交互以及流式视频生成的基座模型。可见反应延迟低于 0.6 秒,端到端 TTFR 低于 1.7 秒,实时视频推理成本在一年内降低 2 个数量级,已接近主流视频平台 CDN 带宽成本量级。
实时交互多模态技术过去最大的瓶颈不是「能不能生成」,而是生成得够不够快、够不够便宜。Vivix 这次拿出的数据,让这两个问题有了新的答案。
注:TTFR 指首次帧反应时间,计入网络传输和直播推流。成本降低基于 Vivix 官方报告,已接近主流视频平台每小时 CDN 带宽成本量级。参数规模为约 30B。
一个诚实的注脚:这些数字是在可控环境下测得的。但即便如此,将实时视频推理成本压缩到 CDN 带宽的量级,意味着这项技术终于有了走出实验室的经济基础。
Vivix 将 A1 定义为首个面向交互式 AI 角色的实时全双工模型。它要解决的问题很直接:让 AI 角色不再只是「固定画面里一张会说话的脸」。
先生成语音,再让嘴型跟上。角色被限制在固定镜头前,无法走动、无法拿取物品,无法对用户中途插话做出实时反应。
角色从一张脸扩展到完整身体。能感知环境,能走动、拿取物品,完成全身表演。用户随时插话,角色随时回应,表情、声音、动作同步变化。
四个能力维度,让角色真正「活」起来
角色可以走动、拿取物品,完成全身表演。线上看房场景中,AI 销售能带你看房子构造,自然走出房间对外观展示,镜头跟随角色移动。
即使角色正在说话或行动,用户依然可以插话、追问或更换话题,不必等它完成这一轮表演。周围环境的声音也会影响角色的反应。
表情、声音、手势和全身动作同步生成。角色开心、惊讶或生气时,变化落在眉毛、额头、眼神和嘴角,也反映在语气和身体姿态上。
互动过程中可随时上传新图片。用户上传一张商品图,角色能根据新图片调整讲解,把商品带进场景并完成拿取和展示,无需重新开始生成。
场景是最好的说明书。
这些能力不是简单串在一起的。
常见的 AI 角色系统让语音识别、语言模型、语音合成和视频驱动依次工作。一个环节完成后,下一个才开始。链路越长,角色越难在行动过程中及时接收新的要求。
Vivix 为 A1 和 W1 设计了原生多模态生成循环——模型持续处理声音、图片和交互信息,同时生成相应的声音与画面。Director Agent 像一个实时导演,判断角色接下来要说什么、做什么,同时记住此前的对话和场景状态。
视频采用流式生成,模型每次向前生成一小段,下一段沿着已发生的内容继续。局部连续性保证前后片段自然衔接,全局序列先验维持人物、背景和动作的长期一致。Vivix-Turbo 通过超低步数蒸馏把推理过程压缩到两步,Vivix Infra 让输入处理、音视频生成、解码和推流同时运行——用户中途改变想法,系统直接调整后续生成,已发生的内容和上下文被保留,无需从头计算。
注:技术架构示意,简化了部分中间环节。Director Agent 与流式生成的协同机制详见 Vivix 官方技术报告。
实时交互多模态的工程门槛正在被系统性攻克。AI 视频从「生成内容」走向「生成体验」,下一轮竞争的关键词将从参数规模转向交互延迟与成本控制。
A1 与 W1 已通过 Vivix API 平台开放,开发者可申请接入。实时交互体验正在从实验室走向真实世界。
Vivix 官网 → 申请体验面向开发者与企业用户,个人体验入口后续开放。