🎬 实时视频 · 架构突破

形界智能 Rise 突破实时视频极限:500ms 体感延迟、1 分钱/秒,端到端架构重构人机交互

2026 年 8 月,形界智能发布全域沉浸式生成基础模型 Rise,采用端到端架构将实时视频生成体感延迟压至 500 毫秒,推理成本降至 每秒 1 分钱。这是国内首家将体感延时控制在 500 毫秒的实时视频生成方案,也是首个将理解与生成统一建模的端到端系统。

综合公开信息整理 2026-08-19 全文约 4 分钟读完
#形界智能 #实时视频生成 #端到端架构 #全域沉浸式
⚡ 500 ms 体感延迟 · 接近无感
1 分/秒 推理成本,传统方案 7 毛/秒
10B 参数规模,端到端统一建模

⚡ 30 秒速览

  • 技术路线:不走离线生成,不走实时流式,形界智能走第三条路——全域沉浸式生成,用摄像头自然交互,无需键盘鼠标。
  • 核心突破:端到端架构,将理解与生成放进同一个模型,去掉翻译与串行,延迟从 4 秒以上压到 500 毫秒。
  • 成本革命:推理成本从每秒 7 毛钱降到 1 分钱,两小时 AI 直播互动成本从 8000 元降至 72 元。
  • 团队底子:CEO 王裕鑫中科大博士,前元石科技 007 号员工,曾带队打造中国 Top6 大模型团队。
  • 产品进度:Genesis 已在 WAIC 2026 亮相,Rise 模型已发布,支持开放世界自由探索。

01三条路线之争 实时视频生成走到分岔口

2026 年年中,实时视频生成赛道骤然升温。Anthropic 被曝以 60 亿美元收购 Decart,Runway、World Labs、Odyssey 单轮融资数亿美金。但比金额更值得玩味的是:行业正在分裂成三条截然不同的技术路线。

路线一:离线生成

Seedance、可灵、Vidu 为代表。将替代实拍与剪辑做到极致,不断增加清晰度与时长。但视频仍是提前做好的成品,观众永远坐在屏幕外面。

路线二:实时流式

World Labs、Odyssey 为代表。可操控视角、改变环境,但需要键盘、鼠标、Prompt 驱动。把人从观众变成玩家,但进入门槛依然存在。

第三条路线:全域沉浸式生成(Immersive)

形界智能 Rise 系列为代表。核心逻辑是——交互的终极形态,不是人去适应模型,而是模型来适应人。用户通过摄像头,用最自然的动作、表情、姿态就能进入和影响视频世界。用户不再需要学习如何发出 AI 能理解的指令,世界开始主动理解用户。

注:三条路线没有绝对对错,分别对应生产工具、实时互动数字世界、更低门槛的世界入口。每条路线背后是一整套关于时间、成本和模型架构的精密算术。

02Rise 关键指标 理解与生成统一建模

形界智能 Rise 模型在三个维度上同时刷新了行业标准:延迟成本架构。传统两段式方案(理解模型 + 生成模型串行)的延迟被牢牢钉在 4 秒以上,而 Rise 将其压缩到接近人类感知阈值以下。

500 毫秒体感延迟
1 分/秒 推理成本
10B 参数规模
300 小时训练数据(赛车场景)

更关键的是,Rise 在 Pre-training 阶段同时学习视频理解、视频生成以及理解与生成的联合建模,让精准的用户行为理解与视频生成成为可能。Post-training 阶段仅用 300 小时赛车数据,就实现了逼真的互动效果。

团队背景:

CEO 王裕鑫中科大博士,五年二十多篇顶会论文,前元石科技 007 号员工,曾牵头组建国内较早 MoE 架构大模型预训练团队,被海外知名 AI 技术评论人评选为 2025 年中国 Top6 大模型团队。团队汇聚中科大院长优秀奖获得者、华为天才少年、字节 Top Seed、阿里星等顶尖人才。

注:延迟数据为体感延时,即从用户动作到画面响应的端到端周期。传统两段式方案延迟通常在 4 秒以上,Rise 通过端到端架构实现数量级压缩。

03端到端架构 去掉翻译,去掉串行

行业此前的实时视频生成,一般把理解动作和生成新画面拆成两个独立模型:摄像头采集画面,先传给理解模型,把动作翻译成指令,再喂给生成模型。一来一回,中间的翻译损耗、通信开销、串行等待,把延迟牢牢钉在 4 秒以上。

Rise 的解法:Native Interactive Representation Scaling

接收视频流输入切分 500ms 窗口联合隐状态推理解码输出噪声块继承

⚙️ 运行机制详解

  • 500 毫秒时间窗口:系统将摄像头采集的真实视觉观测切分为连续的 500 毫秒视频片段,连同系统提示词一同送入基础模型。
  • 噪声块继承:每个窗口内,模型接收当前新视频片段,同时继承上一轮推理的噪声块(部分去噪隐张量),实现时序连贯性。
  • 联合建模:模型同时进行视频理解与视频生成,在同一个隐空间内完成推理,去掉文本翻译环节。
  • 双重输出:解码生成像素级干净视频片段供外部使用,同时保留原始部分去噪隐张量回传至下一窗口。
这套设计换来三个结果:用户通过摄像头直接影响生成;10B 参数将延迟压至 500 毫秒;推理效率指数级上升,成本从 7 毛/秒降到 1 分/秒。

注:噪声块继承机制是端到端架构的关键创新,它让模型在连续时间窗口之间保持隐状态连贯,避免了逐帧独立推理带来的闪烁与断裂。

04成本革命 从 7 毛到 1 分,两个数量级的跨越

实时视频生成过去难以商业化的核心瓶颈,除了延迟,还有算力成本。传统两段式方案每秒推理成本约 7 毛钱,一场两小时的 AI 直播互动要烧掉五千到八千元。Rise 将这一数字直接打到 每秒 1 分钱,且供应商仍有利润空间。

传统两段式方案
7 毛/秒
理解模型 + 生成模型串行
Rise 端到端方案
1 分/秒
成本仅为传统方案的 1/70
两小时直播成本
8000 元 → 72 元
降幅超过 99%

1 分钱定价意味着什么?企业做一场两小时的 AI 直播互动,过去要花五千到八千元,现在只需要 72 元。而且随着架构迭代与芯片适配,成本还有继续下探的空间。当实时视频生成的成本低于传统绿幕直播,商业闭环的临界点就到了。

注:成本对比基于公开报道中的推理成本数据,传统方案为两段式架构的行业平均成本,Rise 为形界智能公布的定价。

编辑核心判断

实时视频生成的终局,不是把画质做到电影级,而是把交互门槛降到呼吸级。当延迟进入 500 毫秒、成本降到 1 分钱,人机交互的范式就从「操作工具」变成了「走进世界」。端到端架构正在重新定义「实时」的标准——而这一次,定义权从模型参数转移到了系统工程。

一个诚实的注脚:Rise 当前在画面精细程度、物理仿真、多人参与等方面与世界模型仍有差距。正如团队所言,当下技术还处在 GPT-3 的前夜。但实时交互的闭环第一次跑通,让数字内容从「被观看的对象」变成「可进入的空间」——这个跨越本身,比任何参数都重要。

现在就能体验

形界智能 Rise 模型已开放场景体验,通过摄像头即可进入实时生成的交互世界。Genesis 模型已在 WAIC 2026 完成公开演示,Rise 已面向企业客户开放接入。

体验入口 · 即将开放