AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

AI 视频

追踪视频生成、理解与编辑工具,关注模型能力如何进入真实创作流程。

全部 Story
19
近 7 天
2
当前结果
9
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文HAS:基于高亮引导注意力调控的多模态大语言模型视频摘要

筛选线索多模态AI 视频AI 主题人工智能1 个独立信源

此前视频摘要方法依赖离散关键帧和片段描述,忽视了帧的全局重要性,可能导致理解不连贯和信息丢失。HAS从全局视角计算连续高亮分布并引导注意力,有望提升摘要的连贯性和信息完整性。

arXiv AI/7月20日 14:27
76
02

论文统一具身合成与世界基础模型:小米机器人U0

筛选线索图像生成多模态模型家族基础模型1 个独立信源

过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。

arXiv AI/7月13日 14:57
70
03

论文异步多模态扩散策略组合:通过延迟感知的引导融合

筛选线索多模态AI 视频多模态模型推理1 个独立信源

此前多模态扩散策略主要采用同步融合或手动设计的多频率架构,导致高频反馈被拖慢或难以扩展新模态。LAG-Fusion允许各模态以原生频率异步运行,解决了这一矛盾,使得机器人可灵活结合不同速率的信息源,提高实时操控性能。

arXiv AI/7月19日 13:48
69
04

论文FilmWorld:通过动态电影世界建模实现小说到电影的智能体生成

筛选线索Agent 智能体AI 视频人工智能智能体1 个独立信源

此前视频生成模型仅擅长短片段、单场景,而FilmWorld针对长篇多场景、实体状态动态演化的复杂需求,首次形式化小说到电影生成任务,并引入智能体协作机制,将抽象文学转化为结构化电影蓝图。

arXiv AI/7月21日 12:28
69
05

论文CG-World:面向世界模型的大规模世界状态数据集与协议

筛选线索多模态AI 视频AI 主题推理能力1 个独立信源

现有视频、机器人和仿真数据集通常只捕获状态、动作或观察的部分结构,CG-World首次系统化整理了工业CG管线中的完整中间状态,并显式记录反事实分支,为世界模型学习联合动力学和干预推理提供了结构化的监督信号,显著增强了可控生成和具身策略迁移的能力。

arXiv AI/7月29日 04:06
69
06

论文FlashRT: 引导代理部署实时多模态应用的代理框架

筛选线索多模态Agent 智能体AI 公司多模态1 个独立信源

传统多模态部署需要手工调整流水线布局与并行策略,FlashRT 通过自动化优化流程,显著降低了开发者的手工工作量,并大幅提升性能。

arXiv AI/7月20日 17:12
68
07

论文MyAG:一个基于图的可组合LLM智能体系统设计与分析框架

筛选线索开源模型与生态Agent 智能体大语言模型发布动态1 个独立信源

该框架首次将LLM智能体系统设计拆分为三个独立的图抽象,使得组件与执行策略可灵活复用,并通过递归节点支持层次化组合。相比以往耦合方式,提供了更清晰的设计模块化和可观测性。

arXiv AI/7月15日 06:03
67
08

论文Text2Sign:一个用于文本到手语视频生成的单GPU扩散基线

筛选线索图像生成多模态多模态模型推理1 个独立信源

此前手语视频生成依赖昂贵的大规模训练和推理资源,Text2Sign通过单GPU即可运行,显著降低了硬件门槛。但生成结果仅为低分辨率短片段,且文本条件控制效果有限,距离实用化仍有较大差距。

arXiv AI/7月14日 18:15
67
09

论文AVA-Encoder:面向智能体的视频表示学习框架

筛选线索Agent 智能体AI 视频推理能力智能体1 个独立信源

此前创意智能体缺乏有效的视频学习方式,难以生成电影级视频。AVA-Encoder通过知识图谱和文本梯度优化,提供了一种结构化且可直接用于智能体推理和编辑的视频表示方法,显著提升了编码性能,并减少了系统提示词使用量,有利于开发更高效的视频生成智能体。

Hugging Face Daily Papers/8月14日 00:00
65