AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

AI 视频

追踪视频生成、理解与编辑工具,关注模型能力如何进入真实创作流程。

全部 Story
19
近 7 天
2
当前结果
19
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

新闻京东开源流式实时视频编辑模型 JoyAI-Video-Edit,支持任意时长编辑

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。

公众号 · 新智元/8月7日 04:07
44
02

产品Qwen-MM-Plugins:让智能体原生支持多模态

筛选线索多模态Agent 智能体模型家族发布动态1 个独立信源

QwenLM 团队发布了 Qwen-MM-Plugins,这是一套插件,旨在让智能体原生支持多模态能力。它能够处理图片、视频和文档,支持视频编辑以及 3D/CAD 数据处理,从而将多模态模型升级为多模态智能体。该项目的演示效果可在其 GitHub 仓库中查看。

AIHOT · X / 公众号精选/8月10日 04:04
57
03

模型Kimi-K3:开放权重多模态智能体模型

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。

Hugging Face Model Radar/6月13日 06:42
65
04

论文HAS:基于高亮引导注意力调控的多模态大语言模型视频摘要

筛选线索多模态AI 视频AI 主题人工智能1 个独立信源

此前视频摘要方法依赖离散关键帧和片段描述,忽视了帧的全局重要性,可能导致理解不连贯和信息丢失。HAS从全局视角计算连续高亮分布并引导注意力,有望提升摘要的连贯性和信息完整性。

arXiv AI/7月20日 14:27
76
05

文章展示:Maginary.ai 新增 seedance2 与 GPT-images2 支持

筛选线索图像生成Agent 智能体模型家族智能体1 个独立信源

Maginary 此前已聚合 40 多个模型,本次新增 seedance2 和 GPT-images2 进一步扩大了可用模型种类,使用户能在统一界面中使用更多生成引擎,而无需分别注册不同服务。

Hacker News AI/7月26日 20:56
41
06

产品OpenChatCut:开源AI agent视频编辑器,带真实时间线

筛选线索开源模型与生态Agent 智能体AI 主题智能体1 个独立信源

OpenChatCut 是一款开源产品,定位为 AI agent 视频编辑器,其核心特点是提供真实时间线(real timeline)编辑界面,用户可借助 AI agent 完成剪辑操作。目前仅知它在 Product Hunt 上发布,具体开发者或团队信息尚未披露。

Product Hunt/7月21日 02:24
49
07

模型MiniMax H3正式开源,支持2K视频与原生立体声的全模态生成系统

筛选线索多模态开源模型与生态模型雷达1 个独立信源

此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。

AIHOT · X / 公众号精选/8月3日 02:44
59
08

论文统一具身合成与世界基础模型:小米机器人U0

筛选线索图像生成多模态模型家族基础模型1 个独立信源

过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。

arXiv AI/7月13日 14:57
70
09

新闻Flux 3可生成20秒带原生音频视频,Black Forest Labs首次实现

筛选线索图像生成多模态基础模型多模态1 个独立信源

此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。

The Decoder AI News/7月23日 18:03
38
10

产品Premation:开源 AI 版 After Effects 替代品

筛选线索开源模型与生态AI 视频AI 主题开源1 个独立信源

Premation 是一款开源的 AI 视频编辑产品,被定位为 Adobe After Effects 的替代品。它于 2026 年 7 月 30 日在 Product Hunt 上发布,目前公开信息有限,仅明确其开源属性和 AI 驱动的特点,旨在为用户提供视频特效制作的另一选择。

Product Hunt/7月30日 02:08
48
11

论文异步多模态扩散策略组合:通过延迟感知的引导融合

筛选线索多模态AI 视频多模态模型推理1 个独立信源

此前多模态扩散策略主要采用同步融合或手动设计的多频率架构,导致高频反馈被拖慢或难以扩展新模态。LAG-Fusion允许各模态以原生频率异步运行,解决了这一矛盾,使得机器人可灵活结合不同速率的信息源,提高实时操控性能。

arXiv AI/7月19日 13:48
69
12

新闻Google Vids 新增个性化 AI 头像,用户可创建自己的数字分身视频

筛选线索图像生成AI 视频AI 主题模型家族1 个独立信源

此前 AI 视频生成通常不包含用户本人的形象,Google Vids 让用户能以数字分身“参演”,降低了个人化视频制作门槛。

TechCrunch AI/7月16日 18:32
37
13

论文FilmWorld:通过动态电影世界建模实现小说到电影的智能体生成

筛选线索Agent 智能体AI 视频人工智能智能体1 个独立信源

此前视频生成模型仅擅长短片段、单场景,而FilmWorld针对长篇多场景、实体状态动态演化的复杂需求,首次形式化小说到电影生成任务,并引入智能体协作机制,将抽象文学转化为结构化电影蓝图。

arXiv AI/7月21日 12:28
69
14

文章Vidmoat:任何AI代理均可操作的视频编辑流水线

筛选线索Agent 智能体AI 视频AI 主题智能体1 个独立信源

尚无中文解读

Hacker News AI/7月21日 00:09
36
15

论文CG-World:面向世界模型的大规模世界状态数据集与协议

筛选线索多模态AI 视频AI 主题推理能力1 个独立信源

现有视频、机器人和仿真数据集通常只捕获状态、动作或观察的部分结构,CG-World首次系统化整理了工业CG管线中的完整中间状态,并显式记录反事实分支,为世界模型学习联合动力学和干预推理提供了结构化的监督信号,显著增强了可控生成和具身策略迁移的能力。

arXiv AI/7月29日 04:06
69
16

论文FlashRT: 引导代理部署实时多模态应用的代理框架

筛选线索多模态Agent 智能体AI 公司多模态1 个独立信源

传统多模态部署需要手工调整流水线布局与并行策略,FlashRT 通过自动化优化流程,显著降低了开发者的手工工作量,并大幅提升性能。

arXiv AI/7月20日 17:12
68
17

论文MyAG:一个基于图的可组合LLM智能体系统设计与分析框架

筛选线索开源模型与生态Agent 智能体大语言模型发布动态1 个独立信源

该框架首次将LLM智能体系统设计拆分为三个独立的图抽象,使得组件与执行策略可灵活复用,并通过递归节点支持层次化组合。相比以往耦合方式,提供了更清晰的设计模块化和可观测性。

arXiv AI/7月15日 06:03
67
18

论文Text2Sign:一个用于文本到手语视频生成的单GPU扩散基线

筛选线索图像生成多模态多模态模型推理1 个独立信源

此前手语视频生成依赖昂贵的大规模训练和推理资源,Text2Sign通过单GPU即可运行,显著降低了硬件门槛。但生成结果仅为低分辨率短片段,且文本条件控制效果有限,距离实用化仍有较大差距。

arXiv AI/7月14日 18:15
67
19

论文AVA-Encoder:面向智能体的视频表示学习框架

筛选线索Agent 智能体AI 视频推理能力智能体1 个独立信源

此前创意智能体缺乏有效的视频学习方式,难以生成电影级视频。AVA-Encoder通过知识图谱和文本梯度优化,提供了一种结构化且可直接用于智能体推理和编辑的视频表示方法,显著提升了编码性能,并减少了系统提示词使用量,有利于开发更高效的视频生成智能体。

Hugging Face Daily Papers/8月14日 00:00
65