AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

多模态

关注模型跨文本、图像、音频和视频理解与交互的能力进展。

全部 Story
248
近 7 天
14
当前结果
16
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

模型Inkling-Small:开放权重多模态模型上线

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。

Hugging Face Model Radar/7月27日 22:33
82
02

模型Qwen3.8-27B:新一代视觉语言模型发布

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。

Hugging Face Model Radar/8月5日 08:22
79
03

模型Inkling:Hugging Face上新的通用多模态开放权重模型

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。

Hugging Face Model Radar/7月14日 13:23
78
04

模型Muse-Glimmer-30B:面向消费硬件的代理模型

筛选线索多模态Agent 智能体AI 公司推理能力1 个独立信源

这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。

Hugging Face Model Radar/8月9日 17:51
76
05

模型ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token

筛选线索多模态大模型与推理AI 公司模型家族1 个独立信源

以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。

Hugging Face Model Radar/7月6日 13:16
71
06

模型Mage-VL:编解码器原生流式多模态模型

筛选线索多模态大模型与推理AI 公司基础模型1 个独立信源

此前多模态模型多依赖预训练视觉编码器并均匀采样视频帧,导致实时流式感知时计算开销大、速度慢。Mage-VL 直接从零训练视觉编码器,并依据编解码器原理动态分配视觉标记,大幅减少标记数量,提升推理速度,为视频理解提供新的高效思路。

Hugging Face Model Radar/7月25日 08:29
69
07

模型通义千问开源Qwen3.8系列,含27B和2.4T模型

筛选线索多模态开源模型与生态模型雷达1 个独立信源

通义千问兑现开源承诺,推出参数更小的Qwen3.8-27B,性能却超越前代Plus级模型,且支持极长上下文,并采用宽松的Apache 2.0许可,这降低了开发者使用和二次开发的门槛。同时开放2.4T超大规模模型权重,为研究社区和商业应用提供了新的选择,可能推动多模态和长文本场景的落地。

AIHOT · X / 公众号精选/8月14日 15:02
65
08

模型dots3-note Preview 开源:280B 参数,支持长程智能体与多模态推理

筛选线索多模态开源模型与生态模型雷达1 个独立信源

dots3-note Preview 的开源为开发者提供了一个轻量且支持长上下文和多模态的模型选择,降低了长程智能体与多模态应用的门槛,可能推动相关领域的技术普及。

AIHOT · X / 公众号精选/8月14日 11:25
65
09

模型Kimi-K3:开放权重多模态智能体模型

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。

Hugging Face Model Radar/6月13日 06:42
65
10

模型Unlimited-OCR 模型发布:推动一次性长视界OCR解析

筛选线索多模态AI 公司模型家族1 个独立信源

相比以往需分块处理的 OCR 模型,Unlimited-OCR 宣称支持一次性长视界解析,可能降低复杂文档(如长合同、书籍)的多步预处理成本,提升整体处理效率。

Hugging Face Model Radar/6月19日 09:40
61
11

模型Kimi K2.7 Code 编码代理模型

筛选线索多模态Agent 智能体AI 公司模型家族1 个独立信源

该模型相比前代 K2.6 在编码代理能力上有实质性提升,同时显著降低了推理时的思考 token 消耗,这意味着在复杂软件工程任务中可更高效地使用模型,降低算力成本。

Hugging Face Model Radar/6月11日 07:51
60
12

模型OpenRouter 上线 FLUX 3 Video 统一多模态模型

筛选线索图像生成多模态AI 主题模型雷达1 个独立信源

此前多模态模型多针对单模态或简单组合,此次 FLUX 3 Video 在 OpenRouter 平台向所有人开放,提供一个基础上同时覆盖视频、音频、图像和动作预测的统一模型家族,降低了多模态应用开发的接入门槛。

AIHOT · X / 公众号精选/8月4日 17:54
60
13

模型商汤开源 SenseNova U1:统一推理与图像生成

筛选线索图像生成多模态模型雷达1 个独立信源

以往推理与图像生成通常由不同模型或流程完成,SenseNova U1 将两者统一,可能简化多模态任务的处理方式,降低集成复杂性,并提高内容生成的连贯性。

AIHOT · X / 公众号精选/8月4日 15:46
60
14

模型商汤发布SenseNova U1.5-Lite-Preview开源模型

筛选线索多模态开源模型与生态模型雷达1 个独立信源

商汤发布轻量级开源模型,以8B参数实现接近闭源商业模型的多模态生成与编辑质量,可能降低高质量多模态模型的使用门槛,并加剧开源与闭源模型的竞争。

AIHOT · X / 公众号精选/8月3日 14:40
59
15

模型MiniMax H3正式开源,支持2K视频与原生立体声的全模态生成系统

筛选线索多模态开源模型与生态模型雷达1 个独立信源

此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。

AIHOT · X / 公众号精选/8月3日 02:44
59
16

模型Kimi K3 开源:2.8T MoE 模型与技术报告

筛选线索多模态开源模型与生态模型家族模型雷达1 个独立信源

Kimi K3 是首个 2.8T 参数的开源 MoE 模型,并具备原生视觉理解与 1M token 超长上下文。每单位计算智能提升 2.5 倍,意味着更强的性能与更低的推理成本,且开源了配套基础设施,降低了多模态、长上下文应用的开发门槛。

AIHOT · X / 公众号精选/7月27日 15:14
57