AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

多模态

关注模型跨文本、图像、音频和视频理解与交互的能力进展。

全部 Story
248
近 7 天
14
当前结果
248
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

新闻新基准测试证实 AI 模型视觉感知能力仍不佳

筛选线索多模态AI 主题模型家族1 个独立信源

此前评估多模态模型时,常将错误归因于推理环节。PerceptionBench 将视觉感知与逻辑推理分离,揭示多数错误发生在早期图像读取阶段,这改变了人们对模型能力瓶颈的认知,有助于更精准地定位和解决基础感知问题。

The Decoder AI News/8月15日 05:30
71
02

产品Qwen-MM-Plugins:让智能体原生支持多模态

筛选线索多模态Agent 智能体模型家族发布动态1 个独立信源

QwenLM 团队发布了 Qwen-MM-Plugins,这是一套插件,旨在让智能体原生支持多模态能力。它能够处理图片、视频和文档,支持视频编辑以及 3D/CAD 数据处理,从而将多模态模型升级为多模态智能体。该项目的演示效果可在其 GitHub 仓库中查看。

AIHOT · X / 公众号精选/8月10日 04:04
57
03

模型Inkling-Small:开放权重多模态模型上线

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。

Hugging Face Model Radar/7月27日 22:33
82
04

论文LLM服务的实证研究:框架、方法与系统设计

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。

arXiv AI/8月4日 02:33
83
05

文章在NVIDIA Jetson AI Lab学习使用LeRobot和ROS 2进行机器人操作

筛选线索多模态具身智能AI 主题多模态1 个独立信源

该视频将前沿VLM/VLA模型引入实际机器人操作,区别于以往单纯模型演示,展示了从模型选型到物理控制的完整路径,可能降低开发者构建物理AI应用的门槛。

YouTube · NVIDIA Developer/8月11日 17:11
69
06

产品Meta 开源 Muse Glimmer 登陆 OpenRouter

筛选线索多模态开源模型与生态AI 主题发布动态1 个独立信源

Meta AI 超级智能实验室发布了首个开放权重模型 Muse Glimmer,并已上线 OpenRouter。这是一款 30B 参数的密集文本+图像模型,采用 Apache 2.0 许可证,定位为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。

AIHOT · X / 公众号精选/8月12日 12:00
57
07

模型Qwen3.8-27B:新一代视觉语言模型发布

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。

Hugging Face Model Radar/8月5日 08:22
79
08

论文ECHO:本地部署的智能健康助手,具备时序记忆、安全护栏与语音评估

筛选线索多模态Agent 智能体模型家族大语言模型1 个独立信源

相比依赖云端的健康助手,ECHO 可在消费硬件本地运行,数据不外传,符合 GDPR 和 KVKK,可能降低隐私合规成本。其安全层超越零样本 LLM,如 Llama 3.3 70B,表明小型模型结合专用模块可达到实用水平,对资源受限场景有意义。

arXiv AI/8月6日 14:44
81
09

文章NVIDIA 探讨机器人学习的 WAM 与 VLA 模型

筛选线索多模态开源模型与生态AI 主题多模态1 个独立信源

机器人基础模型此前多依赖单一方法,而 WAM 和 VLA 各有优劣。Cosmos 3 将动作作为原生模态,并开源模型、数据集和配方,可能改变机器人策略的训练与部署方式,值得关注。

YouTube · NVIDIA Developer/8月5日 04:32
56
10

产品Inkling:开放权重的975B参数多模态微调模型

筛选线索多模态开源模型与生态多模态模型训练1 个独立信源

Inkling 是一个开放权重(open weights)的多模态模型,参数量达 975B,专为微调(fine-tuning)场景设计。该产品允许开发者直接获取预训练权重,并在此基础上针对特定任务进行后训练或定制化调整。目前未公布发布方及具体部署方式,但开放权重特性暗示用户可自行托管和修改模型。

Product Hunt/7月20日 04:25
46
11

模型Inkling:Hugging Face上新的通用多模态开放权重模型

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。

Hugging Face Model Radar/7月14日 13:23
78
12

论文统一智能体:跨设备管理交互

筛选线索多模态Agent 智能体AI 主题大语言模型1 个独立信源

现有智能体系统在跨设备场景中缺乏有效状态管理,多智能体系统也未维护跨设备、跨时间的紧凑携带状态。该论文提出以状态设计为核心的原则,并通过基准测试证明其优势在多种 MLLM 设置下稳健,为跨设备智能体的设计提供了新方向。

arXiv AI/8月6日 08:14
80
13

文章NVIDIA发布Alpamayo 2 Super自动驾驶模型

筛选线索多模态开源模型与生态推理能力多模态1 个独立信源

此前自动驾驶模型多为前视单摄像头,缺乏全景上下文;人工标注长尾驾驶场景成本高、周期长。Alpamayo 2 Super通过开源与自动标注技术,显著降低开发成本和时间,并扩展至任意驾驶领域和地理区域,可能推动自动驾驶研发范式转变。

YouTube · NVIDIA Developer/8月4日 14:52
56
14

产品小红书开源 BigMac:多模态模型训练的新流水线范式

筛选线索多模态开源模型与生态大语言模型发布动态1 个独立信源

小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它利用 LLM 流水线作为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。

AIHOT · X / 公众号精选/7月22日 10:04
39
15

模型Muse-Glimmer-30B:面向消费硬件的代理模型

筛选线索多模态Agent 智能体AI 公司推理能力1 个独立信源

这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。

Hugging Face Model Radar/8月9日 17:51
76
16

论文一种经济高效的多模态LLM推理框架用于不规则临床时间序列问答

筛选线索多模态大模型与推理大语言模型推理能力1 个独立信源

此前多模态时间序列LLM难以处理临床数据的稀疏性、异步性和不规则采样模式。ClinPRISM通过专用架构解决了这一关键局限,并以极低的计算成本(仅16个令牌)实现了快速推理(0.15秒),使临床问答更实用。

arXiv AI/7月28日 16:33
79
17

文章Thinking Machines 在 Hugging Face 发布新模型 Inkling

筛选线索多模态开源模型与生态AI 公司智能体1 个独立信源

Inkling 是罕见的大规模开源多模态 MoE 模型,原生统一处理图像、文本和音频,无需独立编码器,并拥有 1M 上下文窗口。其 Day-0 工具支持和多种量化版本降低了本地部署门槛,可能推动多模态应用和长上下文任务的发展。

YouTube · Hugging Face/7月16日 07:07
52
18

模型ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token

筛选线索多模态大模型与推理AI 公司模型家族1 个独立信源

以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。

Hugging Face Model Radar/7月6日 13:16
71
19

论文当智能体 AI 遇上集成传感与通信

筛选线索多模态Agent 智能体AI 主题人工智能1 个独立信源

此前 ISAC 相关研究(如基于学习的感知、资源分配、RIS、边缘智能、多智能体协调和弹性网络)大多孤立发展,缺乏统一视角。该综述首次将智能体 AI 与 ISAC 系统性地结合,提出闭环框架和成熟度分级,为这一领域提供了统一的研究坐标系,有助于后续研究聚焦、比较和推进。

arXiv AI/8月6日 09:26
79
20

新闻IJCV 2027 特刊征稿:多模态理解与生成走向统一

筛选线索多模态具身智能大语言模型推理能力1 个独立信源

多模态模型从任务专用走向统一模型,试图打通感知、理解、推理与生成,这一变化可能重塑模型架构和评测标准,对多模态 AI 产品的发展方向有潜在影响。

公众号 · PaperWeekly/8月10日 10:09
51
21

模型Mage-VL:编解码器原生流式多模态模型

筛选线索多模态大模型与推理AI 公司基础模型1 个独立信源

此前多模态模型多依赖预训练视觉编码器并均匀采样视频帧,导致实时流式感知时计算开销大、速度慢。Mage-VL 直接从零训练视觉编码器,并依据编解码器原理动态分配视觉标记,大幅减少标记数量,提升推理速度,为视频理解提供新的高效思路。

Hugging Face Model Radar/7月25日 08:29
69
22

论文训练后适配技术的六维分类法及其在AI治理中的应用

筛选线索多模态大模型与推理AI 主题多模态1 个独立信源

此前训练后适配技术文献分散,不同技术族、模型类别与部署场景之间难以比较,也缺乏统一术语,导致无法清晰描述模型如何被修改。该论文首次引入系统化六维分类法,统一了术语并为模型变更追踪和治理提供了分析框架,填补了这一空白。

arXiv AI/8月6日 16:32
78
23

新闻京东开源流式实时视频编辑模型 JoyAI-Video-Edit,支持任意时长编辑

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。

公众号 · 新智元/8月7日 04:07
44
24

模型通义千问开源Qwen3.8系列,含27B和2.4T模型

筛选线索多模态开源模型与生态模型雷达1 个独立信源

通义千问兑现开源承诺,推出参数更小的Qwen3.8-27B,性能却超越前代Plus级模型,且支持极长上下文,并采用宽松的Apache 2.0许可,这降低了开发者使用和二次开发的门槛。同时开放2.4T超大规模模型权重,为研究社区和商业应用提供了新的选择,可能推动多模态和长文本场景的落地。

AIHOT · X / 公众号精选/8月14日 15:02
65
25

论文Boogu-Image-0.1:提升开源统一多模态理解与生成能力

筛选线索图像生成多模态模型家族智能体1 个独立信源

此前开源统一多模态模型在生成质量和速度上普遍落后于闭源系统,Boogu-Image-0.1证明在有限算力下通过优化数据质量、训练管道和推理时缩放即可达到接近闭源产品的水平,且完全开源,降低了高端图像生成与编辑模型的使用和定制门槛。

arXiv AI/7月14日 17:52
78
26

新闻Google 25 年来首次重新设计搜索框,从关键词输入变为 AI 对话入口

筛选线索多模态Agent 智能体AI 主题模型家族1 个独立信源

此前用户只能输入碎片化关键词获得蓝色链接列表;现在搜索框成为一个多模态对话界面,能接受文件、图片等,并引导用户提问。这是 Google 搜索产品定位的根本转变——从结果检索变为 AI 对话入口。

VentureBeat AI/5月19日 17:45
43
27

模型dots3-note Preview 开源:280B 参数,支持长程智能体与多模态推理

筛选线索多模态开源模型与生态模型雷达1 个独立信源

dots3-note Preview 的开源为开发者提供了一个轻量且支持长上下文和多模态的模型选择,降低了长程智能体与多模态应用的门槛,可能推动相关领域的技术普及。

AIHOT · X / 公众号精选/8月14日 11:25
65
28

论文CorePath:用于核心 needle 活检诊断及风险控制报告生成的乳腺专科病理基础模型

筛选线索多模态大模型与推理大语言模型基础模型1 个独立信源

通用病理基础模型在细粒度亚型分型上表现不足,而 CorePath 展示了针对乳腺专科微调的有效性,在公开基准上超越了领先模型,并显著降低非乳腺幻觉,意味着专科化基础模型可能成为病理 AI 提升临床可用性的关键路径。

arXiv AI/8月4日 03:43
78
29

新闻阿里巴巴开源Qwen 3.8,称性能仅次于Fable 5

筛选线索多模态开源模型与生态AI 主题模型家族1 个独立信源

Qwen 3.8将超大参数规模多模态模型以开源权重形式开放,直接对标闭源领先模型,可能降低高端AI能力的获取门槛,推动开源生态竞争。

The Decoder AI News/7月19日 12:07
42
30

模型Kimi-K3:开放权重多模态智能体模型

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。

Hugging Face Model Radar/6月13日 06:42
65
当前展示各类别评分靠前的 30 条,共 248 条