京东开源实时流视频编辑模型支持边看边改

财π新闻 8月5日,京东正式宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,彻底打破传统视频创作“先成片、后修改”的固有流程,让用户在观看视频的过程中就能实时调整人物形象、替换场景元素、切换画面风格,将视频创作升级为可实时互动的全新体验。

长期以来,实时流式视频编辑领域存在两大核心技术瓶颈,一是模型推理速度难以匹配常规视频播放节奏,容易出现卡顿延迟,二是多数同类模型仅能处理几秒到分钟级的短片段,无法支撑长视频的持续编辑。JoyAI-Video-Edit依托全自研的JoyAI-Video底座架构,在720P分辨率下实现每秒30帧的稳定推理,在保持高清画面细节的同时完全适配常见影视视频的播放速率,从根源上解决了实时编辑的流畅性问题。更具突破性的是,该模型实现了任意时长的稳定流式编辑,能够随着视频持续播放同步完成处理,用户无需等待整段视频生成完毕,就能边看边调整内容,大幅降低了创作的时间成本与返工率。

为验证模型性能,技术团队将其与SANA Streaming、LiveEdit、Xmax-X2.0等国际主流流式视频编辑模型开展对比测试,结果显示其综合表现全面领先。在业界通用的OpenVE-Bench评测中,该模型整体效果达到世界一流水平,尤其在全局风格转换、局部物体替换、特定元素删除和字幕编辑等任务上优势突出,兼顾了编辑响应速度与画面最终呈现质量。

目前,这款160亿参数的自回归扩散框架模型,已在多个行业场景展现出落地价值。在电商直播领域,主播可实时为展示中的商品更换款式、调整背景,观众也能即时看到不同穿搭的上身效果;在家装设计场景中,用户可以同步切换家具样式、墙面色彩与灯光氛围,直观对比多种装修方案;影视创作者则能快速尝试不同人物造型与场景风格,减少不必要的重复拍摄。除此之外,该模型还为具身智能训练提供了全新的数据合成路径,可将普通人手操作视频转化为机械臂训练素材,在保留物体空间关系与动作轨迹的基础上替换场景、物体与机器人形态,低成本生成大量特殊场景的训练样本,解决了真机数据采集成本高、高危场景难以复现的行业痛点。

作为京东面向物理世界打造的JoyAI模型矩阵的重要组成部分,JoyAI-Video-Edit处于附身智能与具身智能的交叉节点,与已有的多模态大语言模型条件编码器、多模态扩散Transformer技术体系形成协同,为物理AI发展提供了扎实的基础设施能力支撑。此次开源将相关核心能力向全行业开放,不仅为内容创作领域带来新的变革动力,也将推动多模态AI技术在物理世界场景中的落地应用持续走向深入。

快讯