🎬 模型发布 · 实时流式编辑

京东开源 JoyAI-Video-Edit:视频编辑进入"边播边改"时代

视频生成已经不难,难的是在播放过程中持续修改。京东开源的实时流式视频编辑模型 JoyAI-Video-Edit,把一段持续输入的视频流当作编辑对象——直播中的商品可以随时替换,室内空间可以即刻调整,无需等待完整视频生成。官方数据显示,在单张 NVIDIA B200 GPU 上,端到端吞吐约 30 FPS,请求到响应周期约 266 毫秒

来源:综合公开信息整理 2026-08-05 全文约 4 分钟读完
#京东 #JoyAI-Video-Edit #实时视频编辑 #流式模型 #开源AI
🥇 Top 1 LongV2VBench 长视频持续编辑评测
30 FPS 单卡 B200 端到端吞吐
266 ms 请求到响应周期

⚡ 30 秒速览

  • 核心突破:视频编辑从"离线批处理"转向"流式实时交互"——不用再等完整视频生成,画面边播边改。
  • 实测四场景:直播商品替换、家装效果调整、户外氛围转换、人手替换机械手均能完成,画面保持连续。
  • 技术配置:16B 自回归扩散模型 + 因果视频 VAE + 固定窗口机制 + DMD 蒸馏,单卡 B200 可实时运行。
  • 客观成绩:OpenVE-Bench 总分 3.60,LongV2VBench 长视频评测第一;复杂纹理与多人交互仍是短板。
  • 开源可验证:模型与技术报告均已公开,所有数字可复现、可质疑。

01从"抽卡"到"边播边改"

用 AI 改一段视频,过去是条消耗耐心的链路:输入指令,等待生成,查看效果,不满意再生成。多轮"抽卡"下来,创作过程被拆成一段段等待——AI 在忙,人在等

京东开源的新模型,把这条链路倒了过来。

JoyAI-Video-Edit 处理的不是一段已经结束的视频文件,而是一条持续输入的视频流。视频在播,模型在看,你发出指令,画面随即开始变化——直播里的商品可以替换,室内空间可以调整,户外场景可以改换氛围。

传统离线视频编辑

先拿到完整视频,再分析前后帧关系,最后生成修改结果。画质更可控,但只能"事后修改",覆盖不了直播、视频通话等实时场景。

流式实时编辑(JoyAI-Video-Edit)

只有当前与历史信息,边播边改。响应快、可交互,但对模型的约束更强——无法预知下一秒画面。

两种路线互补而非替代:离线编辑追求最优画质,流式编辑追求最小延迟。

实时速度,只是它要解决的第一个问题。更难的是:如何让画面不漂移?

02为什么可信:评测分数 + 全量开源

视频编辑比单张图片复杂得多。模型既要理解用户想改什么,又要保持人物身份、动作轨迹和未改区域的稳定。更关键的是,持续播放的视频里,前面的生成结果会成为后续处理的参考——误差一旦累积,画面就会漂移

3.60OpenVE-Bench 短视频编辑总分
Top 1LongV2VBench 长视频评测
16B参数规模
4 类官方标注突出任务
全局风格变化 局部替换 局部删除 字幕编辑

OpenVE-Bench 总分 3.60,突出任务类型由官方技术报告标注;LongV2VBench 主要考察长视频跨片段稳定性。

比榜单更硬气的,是开源。模型权重与技术报告一并公开——每一分都可以被复现,也可以被质疑。在评测水分普遍存在的当下,敢开源本身就是一种表态。

03它能做什么:四个真实场景实测

榜单是抽象的,真实场景才见真章。以下测试覆盖两个"最容易落地"和两个"最难"的任务。

📺 直播带货 · 商品实时替换基础可用

  • 模特走秀画面,按指令替换商品,人物动作与原环境保持不变。
  • 替换后的商品跟随人物动作持续出现,视频保持连续播放。
  • 复杂纹理、文字或细小结构时,编辑难度明显增加。
商品与人的空间关系是核心难点,本场景下基本稳定。

🏠 家装调整 · 效果即时呈现接近落地

  • 室内空间画面,按指令调整家具风格与整体环境。
  • 在真实视频上直接修改,保持原有镜头运动与空间结构
相比单独生成一张效果图,这种方式让用户基于真实空间快速预览,适合方案沟通。

🌤 户外场景 · 环境氛围转换完成度高

  • 去除画面中的人物,仅保留环境。
  • 按指令改变天气与整体氛围,修改结果与原视频自然融合
环境类任务的容错度天然较高,是流式编辑最容易出效果的场景。

🦾 具身智能 · 人手替换机械手视觉可行

  • 人手操作视频中,将人手替换为机械手,同时保持原有抓取动作。
  • 机械结构跟随动作变化,物体位置关系基本保持
  • 距离机器人训练仍有距离:力度、碰撞、环境反馈等物理数据缺失。
当前更像视觉数据生成与扩增工具,而非完整的机器人训练数据方案。

以上为公开实测观察,结果受测试场景与 prompt 设计影响,不代表所有环境下的一致表现。

04为什么能做到:把无限视频流装进有限算力

一句话总结:把"无限长的视频流"压缩进"有限的算力"。

多模态语言模型编码器 因果视频 VAE Chunk 流式单元 多模态扩散 Transformer
  • 因果注意力:模型只能看到当前与历史信息,天然符合实时输入的要求,不从未来帧"偷看"。
  • 固定窗口机制:只保留近期视频状态与关键参考信息,视频再长,计算与显存不会无限增长。
  • Source-Anchored DMD 蒸馏:把推理步骤压缩到实时可用区间,16B 参数量也能在单卡上跑起来。
参数规模16B
端到端吞吐约 30 FPS
请求到响应约 266 ms
运行环境单张 NVIDIA B200

官方测试数据基于单张 NVIDIA B200,实际部署速度随场景复杂度与视频分辨率浮动。

05怎么判断:行业坐标与两个诚实的边界

把 JoyAI-Video-Edit 放进行业坐标系,它和常见的视频生成模型并不是同一个物种

视频生成解决"从无到有"——Seedance、可灵、Vidu、MiniMax H3 在时长、画质、运动表现上持续竞争;视频编辑解决"从有到优"——Runway 等工具已经验证了离线编辑的价值,而实时流式编辑是这个赛道刚出现的新变量。

✅ 已经能打(实测可验证)

  • 直播带货单商品替换
  • 家装即时调整
  • 环境氛围转换

⚠️ 仍然脆弱(商用前需解决)

  • 复杂运动、细节纹理、多人交互
  • 实时推理的算力成本
  • 物理反馈(力度/碰撞)不属于纯视觉

以上边界基于公开实测与技术报告综合判断,不代表所有场景下的能力上限。

成绩之外,更值得讨论的是:为什么这件事值得被开源?

编辑核心判断

视频生成解决"从无到有",实时视频编辑解决"从有到优"。京东把"边播边改"从演示推向开源,让所有数字接受全行业复现与质疑——这比发布会的 Demo 更有说服力。但真正的分水岭不是 30 FPS 的演示速度,而是复杂场景下不漂移、不跳变、能扛住商用压力的稳定性。谁先跨过工程化这道坎,谁就定义下一代视频创作工具。

现在就能验证

JoyAI-Video-Edit 模型权重与技术报告均已公开,可自行部署复现。

GitHub 搜索 JoyAI-Video-Edit