新闻京东开源流式实时视频编辑模型 JoyAI-Video-Edit,支持任意时长编辑
此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。
TOPIC · CURATED VIEW
追踪视频生成、理解与编辑工具,关注模型能力如何进入真实创作流程。
此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。
QwenLM 团队发布了 Qwen-MM-Plugins,这是一套插件,旨在让智能体原生支持多模态能力。它能够处理图片、视频和文档,支持视频编辑以及 3D/CAD 数据处理,从而将多模态模型升级为多模态智能体。该项目的演示效果可在其 GitHub 仓库中查看。
这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。
此前视频摘要方法依赖离散关键帧和片段描述,忽视了帧的全局重要性,可能导致理解不连贯和信息丢失。HAS从全局视角计算连续高亮分布并引导注意力,有望提升摘要的连贯性和信息完整性。
Maginary 此前已聚合 40 多个模型,本次新增 seedance2 和 GPT-images2 进一步扩大了可用模型种类,使用户能在统一界面中使用更多生成引擎,而无需分别注册不同服务。
OpenChatCut 是一款开源产品,定位为 AI agent 视频编辑器,其核心特点是提供真实时间线(real timeline)编辑界面,用户可借助 AI agent 完成剪辑操作。目前仅知它在 Product Hunt 上发布,具体开发者或团队信息尚未披露。
此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。
过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。
此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。
Premation 是一款开源的 AI 视频编辑产品,被定位为 Adobe After Effects 的替代品。它于 2026 年 7 月 30 日在 Product Hunt 上发布,目前公开信息有限,仅明确其开源属性和 AI 驱动的特点,旨在为用户提供视频特效制作的另一选择。
此前多模态扩散策略主要采用同步融合或手动设计的多频率架构,导致高频反馈被拖慢或难以扩展新模态。LAG-Fusion允许各模态以原生频率异步运行,解决了这一矛盾,使得机器人可灵活结合不同速率的信息源,提高实时操控性能。
此前 AI 视频生成通常不包含用户本人的形象,Google Vids 让用户能以数字分身“参演”,降低了个人化视频制作门槛。
此前视频生成模型仅擅长短片段、单场景,而FilmWorld针对长篇多场景、实体状态动态演化的复杂需求,首次形式化小说到电影生成任务,并引入智能体协作机制,将抽象文学转化为结构化电影蓝图。
尚无中文解读
现有视频、机器人和仿真数据集通常只捕获状态、动作或观察的部分结构,CG-World首次系统化整理了工业CG管线中的完整中间状态,并显式记录反事实分支,为世界模型学习联合动力学和干预推理提供了结构化的监督信号,显著增强了可控生成和具身策略迁移的能力。
传统多模态部署需要手工调整流水线布局与并行策略,FlashRT 通过自动化优化流程,显著降低了开发者的手工工作量,并大幅提升性能。
该框架首次将LLM智能体系统设计拆分为三个独立的图抽象,使得组件与执行策略可灵活复用,并通过递归节点支持层次化组合。相比以往耦合方式,提供了更清晰的设计模块化和可观测性。
此前手语视频生成依赖昂贵的大规模训练和推理资源,Text2Sign通过单GPU即可运行,显著降低了硬件门槛。但生成结果仅为低分辨率短片段,且文本条件控制效果有限,距离实用化仍有较大差距。
此前创意智能体缺乏有效的视频学习方式,难以生成电影级视频。AVA-Encoder通过知识图谱和文本梯度优化,提供了一种结构化且可直接用于智能体推理和编辑的视频表示方法,显著提升了编码性能,并减少了系统提示词使用量,有利于开发更高效的视频生成智能体。