论文HAS:基于高亮引导注意力调控的多模态大语言模型视频摘要
此前视频摘要方法依赖离散关键帧和片段描述,忽视了帧的全局重要性,可能导致理解不连贯和信息丢失。HAS从全局视角计算连续高亮分布并引导注意力,有望提升摘要的连贯性和信息完整性。
TOPIC · CURATED VIEW
追踪视频生成、理解与编辑工具,关注模型能力如何进入真实创作流程。
此前视频摘要方法依赖离散关键帧和片段描述,忽视了帧的全局重要性,可能导致理解不连贯和信息丢失。HAS从全局视角计算连续高亮分布并引导注意力,有望提升摘要的连贯性和信息完整性。
过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。
此前多模态扩散策略主要采用同步融合或手动设计的多频率架构,导致高频反馈被拖慢或难以扩展新模态。LAG-Fusion允许各模态以原生频率异步运行,解决了这一矛盾,使得机器人可灵活结合不同速率的信息源,提高实时操控性能。
此前视频生成模型仅擅长短片段、单场景,而FilmWorld针对长篇多场景、实体状态动态演化的复杂需求,首次形式化小说到电影生成任务,并引入智能体协作机制,将抽象文学转化为结构化电影蓝图。
现有视频、机器人和仿真数据集通常只捕获状态、动作或观察的部分结构,CG-World首次系统化整理了工业CG管线中的完整中间状态,并显式记录反事实分支,为世界模型学习联合动力学和干预推理提供了结构化的监督信号,显著增强了可控生成和具身策略迁移的能力。
传统多模态部署需要手工调整流水线布局与并行策略,FlashRT 通过自动化优化流程,显著降低了开发者的手工工作量,并大幅提升性能。
该框架首次将LLM智能体系统设计拆分为三个独立的图抽象,使得组件与执行策略可灵活复用,并通过递归节点支持层次化组合。相比以往耦合方式,提供了更清晰的设计模块化和可观测性。
此前手语视频生成依赖昂贵的大规模训练和推理资源,Text2Sign通过单GPU即可运行,显著降低了硬件门槛。但生成结果仅为低分辨率短片段,且文本条件控制效果有限,距离实用化仍有较大差距。
此前创意智能体缺乏有效的视频学习方式,难以生成电影级视频。AVA-Encoder通过知识图谱和文本梯度优化,提供了一种结构化且可直接用于智能体推理和编辑的视频表示方法,显著提升了编码性能,并减少了系统提示词使用量,有利于开发更高效的视频生成智能体。