京东开源 JoyAI-Video-Edit:视频编辑进入"边播边改"时代
视频生成已经不难,难的是在播放过程中持续修改。京东开源的实时流式视频编辑模型 JoyAI-Video-Edit,把一段持续输入的视频流当作编辑对象——直播中的商品可以随时替换,室内空间可以即刻调整,无需等待完整视频生成。官方数据显示,在单张 NVIDIA B200 GPU 上,端到端吞吐约 30 FPS,请求到响应周期约 266 毫秒。
视频生成已经不难,难的是在播放过程中持续修改。京东开源的实时流式视频编辑模型 JoyAI-Video-Edit,把一段持续输入的视频流当作编辑对象——直播中的商品可以随时替换,室内空间可以即刻调整,无需等待完整视频生成。官方数据显示,在单张 NVIDIA B200 GPU 上,端到端吞吐约 30 FPS,请求到响应周期约 266 毫秒。
用 AI 改一段视频,过去是条消耗耐心的链路:输入指令,等待生成,查看效果,不满意再生成。多轮"抽卡"下来,创作过程被拆成一段段等待——AI 在忙,人在等。
京东开源的新模型,把这条链路倒了过来。
JoyAI-Video-Edit 处理的不是一段已经结束的视频文件,而是一条持续输入的视频流。视频在播,模型在看,你发出指令,画面随即开始变化——直播里的商品可以替换,室内空间可以调整,户外场景可以改换氛围。
先拿到完整视频,再分析前后帧关系,最后生成修改结果。画质更可控,但只能"事后修改",覆盖不了直播、视频通话等实时场景。
只有当前与历史信息,边播边改。响应快、可交互,但对模型的约束更强——无法预知下一秒画面。
两种路线互补而非替代:离线编辑追求最优画质,流式编辑追求最小延迟。
实时速度,只是它要解决的第一个问题。更难的是:如何让画面不漂移?
视频编辑比单张图片复杂得多。模型既要理解用户想改什么,又要保持人物身份、动作轨迹和未改区域的稳定。更关键的是,持续播放的视频里,前面的生成结果会成为后续处理的参考——误差一旦累积,画面就会漂移。
OpenVE-Bench 总分 3.60,突出任务类型由官方技术报告标注;LongV2VBench 主要考察长视频跨片段稳定性。
比榜单更硬气的,是开源。模型权重与技术报告一并公开——每一分都可以被复现,也可以被质疑。在评测水分普遍存在的当下,敢开源本身就是一种表态。
榜单是抽象的,真实场景才见真章。以下测试覆盖两个"最容易落地"和两个"最难"的任务。
以上为公开实测观察,结果受测试场景与 prompt 设计影响,不代表所有环境下的一致表现。
一句话总结:把"无限长的视频流"压缩进"有限的算力"。
官方测试数据基于单张 NVIDIA B200,实际部署速度随场景复杂度与视频分辨率浮动。
把 JoyAI-Video-Edit 放进行业坐标系,它和常见的视频生成模型并不是同一个物种。
视频生成解决"从无到有"——Seedance、可灵、Vidu、MiniMax H3 在时长、画质、运动表现上持续竞争;视频编辑解决"从有到优"——Runway 等工具已经验证了离线编辑的价值,而实时流式编辑是这个赛道刚出现的新变量。
以上边界基于公开实测与技术报告综合判断,不代表所有场景下的能力上限。
成绩之外,更值得讨论的是:为什么这件事值得被开源?
视频生成解决"从无到有",实时视频编辑解决"从有到优"。京东把"边播边改"从演示推向开源,让所有数字接受全行业复现与质疑——这比发布会的 Demo 更有说服力。但真正的分水岭不是 30 FPS 的演示速度,而是复杂场景下不漂移、不跳变、能扛住商用压力的稳定性。谁先跨过工程化这道坎,谁就定义下一代视频创作工具。
JoyAI-Video-Edit 模型权重与技术报告均已公开,可自行部署复现。
GitHub 搜索 JoyAI-Video-Edit