🔥 模型 · 首发

Vivix 发首个实时交互多模态模型,近 30B 参数跑进消费级显卡

7 月 25 日,Vivix 发布实时交互多模态模型 A1——用户可像打视频电话一样,与屏幕另一端的虚拟角色持续交流;角色能听、能转身、能行动,并与所在世界持续互动。同步发布的 W1 则允许用户随时介入改变剧情走向。

来源:官方发布 2026-07-25 全文约 4 分钟读完
#Vivix #实时交互 #多模态 #流式生成
0.6 端到端平均响应延迟
10000+ 单卡 video tokens/s 吞吐
2 8 步蒸馏压缩后的推理步数

⚡ 30 秒速览

  • 是什么:首个在原生流式架构中统一「多模态参考 + 实时交互 + 流式生成」的基础模型,角色拥有身体、能行动转身、与环境持续互动。
  • 多快:流式调度器响应新输入最短 300 毫秒,从用户给出指令到画面出现可见反应,平均延迟低于 0.6 秒。
  • 多大:近 30B 激活参数,通过原生 NVFP4 训推协同 + 自研 VMI 基础设施,部署门槛压到消费级 GPU;单卡吞吐超 10000 video tokens/s。
  • 怎么做到:统一流式架构 + 原生多模态建模 + MJD 多维联合蒸馏(8 步压 2 步)+ Encoder/Decoder 解耦 + 计算通信内存协同调度。
  • 去哪体验:官网及 API 开放平台已开放内测申请。

01它到底能做什么?三个真实场景

🐱 角色实时互动:会回应的"平行世界"小猫非预编排

  • 一只小猫能一边说土味情话,一边弓背、摇尾巴、抬爪子,并在自己的世界里来回走动——脚下的影子也会随之变化。
  • 反应并非提前编排:你说一句,它就根据新输入即时作出新的动作和回应。
  • 角色不再只对着镜头说话,而是真正拥有身体,能行动、转身、改变姿态,与环境持续互动。

🎬 世界可介入:W1 让你改变剧情走向同步发布

  • 用户不再只是站在屏幕外看故事,而是可以随时介入
  • 能改变人物的选择、行动,以及接下来的剧情走向。

📞 像视频电话一样的持续交流300ms 响应

  • 这边话音刚落,屏幕另一端的角色基本已经动起来。
  • 流式调度器响应新输入最短仅需 300 毫秒,端到端平均延迟 0.6 秒

02为什么可信:统一流式架构

要接通这通"平行世界的视频电话",第一步不是让角色回答得多聪明,而是让它在持续生成中,始终还是同一个角色、身处同一个世界

传统 Clip-based 视频模型

一次生成一个完整片段,可提前统筹前后动作和画面,较易保证一致性——但无法实时响应新输入。

A1 原生流式架构

不知道几秒之后会发生什么,一边看已生成画面,一边接收新指令,实时预测下一段——像一边铺铁轨一边开火车。

A1 的解法,是把图片、视频、声音、交互历史和已生成内容共同写入持续状态,让它们在后续流式生成中反复生效:

局部连续性先验相邻动作自然接上
全局序列先验长期角色身份/场景/物体关系

同时,A1 摒弃了"ASR→LLM→TTS→Motion"的串行流水线,直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号。用户的语气变化、环境雷声、画面中的手势,都可以成为新的触发信号——这就是 A1 强调的持续聆听与事件触发响应

架构内还分了快慢两条思考线:模型在最小时间片(约 300ms)内推理出最新响应 token(快思考);上层的 Director Agent 则负责推理、思考、tool use,异步给出长时序宏观行为控制(慢思考)。

03怎么做到实时:三步压榨算力

近 30B 激活参数的模型跑进消费级显卡,Vivix 的解法是一套叫 VMI(Vivix Model Infra) 的推理基础设施,三步组合拳:

8→2采样步压缩
4-bit原生 NVFP4
88%+PCIe 带宽利用率
2 个数量级推理效率提升

① MJD:8 步蒸馏到 2 步

  • 以 8-Step 版本为质量基线,把不同去噪阶段承担的能力共同压缩进 2-Step 模型,而非只针对单帧画质蒸馏。
  • 同时优化三个目标:短时生成质量、长时时间一致性、多模态分布对齐。
  • 为防止"少动换稳定",让学生模型学习教师模型更完整的动作分布,在 latent 潜空间和原始数据空间中双路优化。

② 原生 NVFP4 训推协同

  • 把 Blackwell GPU 支持的 NVFP4 GEMM 直接设为目标推理路径。
  • 关键:不是训练完成后做 PTQ,而是在训练和蒸馏阶段就引入 low-precision-aware distillation,让模型提前适应 4-bit 数值分布。
  • 针对视频生成链路加入专门的去噪误差校正,压住量化误差在不同 timestep 和连续帧之间的累积。
  • 实测:相对 BF16 基线生成质量接近无损,同时降低显存占用并提高推理吞吐。

③ Encoder/Decoder 解耦 + 协同调度

  • 解耦:多模态 Encoder(追求高吞吐)与 Real-Time Decoder Loop(追求低延迟)拆成独立服务,避免批量任务堵住实时链路;推理阶段引入 prefill/decode 分离,重设 KV Cache 传输层。
  • 协同:Compute-Communication-Memory Co-Scheduling Engine 将计算、通信、显存调度统一纳入同一张推理执行图;Attention 通信、显存 Offload、跨服务数据传输跑在不同 CUDA Stream 中,与 GPU 计算重叠。
  • 合并:计算与通信融合进 Mega Kernel,减少中间状态写回;用 CUDA Graphs 捕获整张流式推理图,把数百次 Kernel Launch 压缩成少量统一提交。

注:以上数据引自 Vivix 官网技术博客,未见第三方独立复测;实际部署表现以公开复现结果为准。

04编辑视角

SOURCE CHECK · 来源立场提示

本文核心数据与架构细节全部引自 Vivix 官网技术博客,属企业单方披露:10000 video tokens/s 的单卡吞吐、0.6 秒端到端延迟、88%+ PCIe 带宽利用率等关键指标,目前未见第三方独立复测。读者宜将其视为"工程目标已达成"的声明,而非已验证的基准成绩。

从技术路线本身看,Vivix 把"多模态参考 + 实时交互 + 流式生成"塞进同一套原生架构,并用 MJD + NVFP4 + VMI 三层组合把近 30B 参数压进消费级显卡——这条路径若可复现,意味着实时交互视频的部署门槛正从"数据中心级"向"桌面级"迁移。

判断:实时多模态交互的竞争焦点,已从"模型能不能生成"转向"工程能不能实时跑"——后者正在成为新的分水岭。

现在就能申请

A1 与 W1 已开放内测,访问官网及 API 开放平台提交申请。

vivix.ai → 申请内测