AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

多模态

关注模型跨文本、图像、音频和视频理解与交互的能力进展。

全部 Story
248
近 7 天
14
当前结果
8
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

新闻新基准测试证实 AI 模型视觉感知能力仍不佳

筛选线索多模态AI 主题模型家族1 个独立信源

此前评估多模态模型时,常将错误归因于推理环节。PerceptionBench 将视觉感知与逻辑推理分离,揭示多数错误发生在早期图像读取阶段,这改变了人们对模型能力瓶颈的认知,有助于更精准地定位和解决基础感知问题。

The Decoder AI News/8月15日 05:30
71
02

新闻IJCV 2027 特刊征稿:多模态理解与生成走向统一

筛选线索多模态具身智能大语言模型推理能力1 个独立信源

多模态模型从任务专用走向统一模型,试图打通感知、理解、推理与生成,这一变化可能重塑模型架构和评测标准,对多模态 AI 产品的发展方向有潜在影响。

公众号 · PaperWeekly/8月10日 10:09
51
03

新闻京东开源流式实时视频编辑模型 JoyAI-Video-Edit,支持任意时长编辑

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。

公众号 · 新智元/8月7日 04:07
44
04

新闻Google 25 年来首次重新设计搜索框,从关键词输入变为 AI 对话入口

筛选线索多模态Agent 智能体AI 主题模型家族1 个独立信源

此前用户只能输入碎片化关键词获得蓝色链接列表;现在搜索框成为一个多模态对话界面,能接受文件、图片等,并引导用户提问。这是 Google 搜索产品定位的根本转变——从结果检索变为 AI 对话入口。

VentureBeat AI/5月19日 17:45
43
05

新闻阿里巴巴开源Qwen 3.8,称性能仅次于Fable 5

筛选线索多模态开源模型与生态AI 主题模型家族1 个独立信源

Qwen 3.8将超大参数规模多模态模型以开源权重形式开放,直接对标闭源领先模型,可能降低高端AI能力的获取门槛,推动开源生态竞争。

The Decoder AI News/7月19日 12:07
42
06

新闻Flux 3可生成20秒带原生音频视频,Black Forest Labs首次实现

筛选线索图像生成多模态基础模型多模态1 个独立信源

此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。

The Decoder AI News/7月23日 18:03
38
07

新闻亚马逊据报缩减Nova AI模型,押注新前沿研究团队

筛选线索多模态大模型与推理AI 主题基础模型1 个独立信源

亚马逊此前同时在多个方向推进Nova模型(如文本、多模态、视频等),此次战略收缩意味着其放弃了多模型并行策略,转而集中资源打造一款旗舰级基础模型。这一变化可能影响依赖Nova API的现有客户,也表明亚马逊正在调整其AI竞争路径。

The Decoder AI News/7月28日 16:03
38
08

新闻AI重塑骨科学研究:从机制解析到精准医疗的综述

筛选线索多模态具身智能AI 主题人工智能1 个独立信源

此前AI在骨科的应用主要集中于影像诊断,缺乏系统性梳理。该综述首次全面整合了AI在骨科学基础研究(如多组学整合、靶点发现)和临床应用(如诊断、手术导航、预后预测)中的进展,并指出多模态数据整合、模型可解释性等关键瓶颈,为该领域提供了整体研究框架,有助于推动骨科研究向智能化、精准化转型。

公众号 · PaperWeekly/7月30日 04:47
38