首页 > 教程攻略 > ai资讯 >京东开源视频实时编辑模型:30 帧秒级推理,边看边改重新定义视频创作

京东开源视频实时编辑模型:30 帧秒级推理,边看边改重新定义视频创作

来源:互联网 时间:2026-08-05 14:15:46

京东最近放了个大招——开源了自研的实时流式视频编辑模型 JoyAI-Video-Edit。简单说,以后看视频的时候就能顺手改画面,人物、场景都能实时调整,不用再像以前那样,先找好素材再慢慢修。京东官方表示,在流式实时视频编辑这个方向上,这个模型对比业内现有的代表性模型,各项指标全面领先,已经达到世界一流水平。

image.png

视频实时编辑,首先得解决速度问题。视频本身就是一帧帧连续画面组成的,如果模型处理速度跟不上播放速度,卡顿和延迟就不可避免。JoyAI-Video-Edit 基于全自研的 JoyAI-Video 模型,在 720P 分辨率下实现了每秒 30 帧的模型推理速度,这意味着它既能保持较高的画面清晰度,又能跟上常见影视视频的播放节奏。

视频长度是流式编辑的另一道门槛。以前的流式编辑模型只能处理几秒或分钟级的片段,而 JoyAI-Video-Edit 支持任意时长的稳定流式编辑——视频边播放,它边处理。用户不用等整段视频生成完,就能在播放过程中实时修改场景、替换物体、调整人物形象,或者改变画面风格。用一句话总结:边观看边创作,真正成了现实。

权威评测全面登顶,四类编辑任务优势突出

为了评估模型能力,研究团队把 JoyAI-Video-Edit 和 SANA Streaming、LiveEdit、Xmax-X2.0 等国际代表性流式视频编辑模型拉出来比了比。结果相当亮眼:在覆盖典型视频编辑场景的评测数据中,JoyAI-Video-Edit 整体效果全面领先。

在业界公认的 OpenVE-Bench 通用评测中,这个模型超越了目前所有流式编辑方法,特别是在全局风格、局部替换、局部删除和字幕编辑这四类任务上,优势非常突出,大幅领先行业同类模型。具体到应用场景:创作者可以让视频里的人物连续换装,直播时把普通街道变成动画世界,甚至在家装设计中尝试不同的家具、墙面和灯光效果——这些以前只能靠后期特效完成的事,现在实时就能搞定。

不止视频创作,还能为机器人“量产”训练数据

更值得关注的是,JoyAI-Video-Edit 为具身智能数据的大规模合成开辟了一条新路。机器人训练需要大量物体抓取、搬运和操作的视频,但真机数据采集成本高,危险或罕见的场景也很难反复采集。

依托对场景、物体和画面内容的可控编辑能力,JoyAI-Video-Edit 可以把人手操作视频直接转化为机械手或机械臂的操作素材,在保留物体位置、空间关系和动作轨迹的基础上,替换场景、物体和机器人形态,让一段视频扩展出成倍的训练样本。从视频创作到机器人训练数据合成,这款模型的开源,很可能给多个赛道同时打开全新的想象空间。