视频能“边播边改”:京东开源自研JoyAI-Video-Edit模型
京东开源实时流式视频编辑模型 JoyAI-Video-Edit,实现边看边改
2025年8月5日,京东宣布正式开源其自研的实时流式视频编辑模型
JoyAI-Video-Edit
视频实时编辑的核心突破:速度与时长
视频实时编辑首先要解决速度问题。视频由一帧帧连续画面组成,如果模型处理速度跟不上播放速度,就会出现卡顿与延迟。JoyAI-Video-Edit 基于全自研 JoyAI-Video 模型,在 720P 分辨率下实现每秒 30 帧的模型推理速度,能够在保持较高画面清晰度的同时,跟上常见影视视频的播放节奏。
视频长度也是流式编辑的一道门槛。此前的流式编辑模型只能处理几秒或分钟级片段,而 JoyAI-Video-Edit 支持任意时长的稳定流式编辑,可以随着视频持续播放、持续处理。用户不必等待整段视频生成完成,就能在播放过程中实时修改场景、替换物体、调整人物形象或改变画面风格。
小提示:
丰富的应用场景
创作者可以借助 JoyAI-Video-Edit 实现多种创意操作,例如:
- 让视频中的人物连续更换服装
- 在直播中把普通街道变成动画世界
- 在家装设计中尝试不同的家具、墙面和灯光效果
以下为官方展示的示例效果:



性能评测全面领先
为了评估模型能力,研究团队将 JoyAI-Video-Edit 与 SANA Streaming、LiveEdit、Xmax-X2.0 等国际上有代表性流式视频编辑模型进行对比。结果显示,在覆盖典型视频编辑场景的评测数据中,JoyAI-Video-Edit 整体效果全面领先。

在业界权威的
OpenVE-Bench
为具身智能数据合成开辟新路径
不止视频创作,JoyAI-Video-Edit 还为具身智能数据大规模合成提供了新的技术路径。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本较高,危险或少见场景也难以反复采集。
依托对场景、物体与画面内容的可控编辑能力,JoyAI-Video-Edit 可将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,让一段视频扩展出更多训练样本。
开源地址
IT之家附 JoyAI-Video-Edit 开源地址如下:
(注:原文未提供具体链接,请关注官方后续发布。)
常见问题解答
问:什么是流式视频编辑?
答:流式视频编辑指在视频播放过程中实时进行编辑操作,无需等待整段视频生成完成,用户可边看边修改。问:JoyAI-Video-Edit 支持哪些视频分辨率?
答:官方展示在 720P 分辨率下可实现每秒 30 帧的推理速度,但具体支持的分辨率范围请参考开源项目文档。问:该模型开源后如何获取?
答:请关注京东官方发布的 JoyAI-Video-Edit 开源仓库,后续将在 GitHub 等平台开放代码和模型权重。