AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
2026年8月16日星期日

本期概览

7

约 5 分钟读完

新闻
3
论文
2
产品
0
模型
2
阅读本期日报

今日焦点

新基准测试证实 AI 模型视觉感知能力仍不佳

发生了什么
Moonshot AI 发布新基准测试 PerceptionBench,用于评估多模态 AI 模型的视觉感知能力,独立于逻辑推理。结果显示,目前没有任何前沿模型达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。许多原本被认为是推理错误的案例,实际在图像读取阶段就已出现。
为什么值得看
此前评估多模态模型时,常将错误归因于推理环节。PerceptionBench 将视觉感知与逻辑推理分离,揭示多数错误发生在早期图像读取阶段,这改变了人们对模型能力瓶颈的认知,有助于更精准地定位和解决基础感知问题。
新闻评分71类别:新闻来源:The Decoder AI News阅读全文
全部新闻论文产品模型

情报流

#Story为什么值得看类别评分
16

模型蚂蚁百灵开源 Ling-3.0-flash:124B 参数 MoE 模型,支持多版本部署

筛选线索开源模型与生态大模型与推理开发者平台模型雷达1 个独立信源

该模型是蚂蚁百灵开源的 MoE 模型,总参数达 124B,激活参数仅 5.1B,显著降低推理成本,并提供多种量化版本,体现开源生态在模型效率和部署灵活性上的进展。

AIHOT · X / 公众号精选/8月7日 12:02
66
17

模型LFM2.5-2.6B 模型发布:面向设备端的轻量级智能体

筛选线索Agent 智能体大模型与推理AI 公司智能体1 个独立信源

此前小型模型较少具备与更大模型竞争的智能体能力,LFM2.5-2.6B 以 2.6B 参数在工具使用和指令遵循上对标大 4 倍的模型,且能在常见消费级硬件上流畅运行,可能推动设备端智能体应用普及。

Hugging Face Model Radar/7月28日 22:14
66
18

模型Gemini 3.7 Flash 向 Pro 与 Ultra 用户全面开放

筛选线索Agent 智能体AI 主题模型家族1 个独立信源

此前该模型可能仅限部分用户或未集成 Spark,现在 Pro/Ultra 用户可体验更强的多步骤推理,且 Spark 结合 Workspace 工具调用,显著增强个人智能体的实用性与精准度。

AIHOT · X / 公众号精选/8月14日 18:06
66
19

模型通义千问开源Qwen3.8系列,含27B和2.4T模型

筛选线索多模态开源模型与生态模型雷达1 个独立信源

通义千问兑现开源承诺,推出参数更小的Qwen3.8-27B,性能却超越前代Plus级模型,且支持极长上下文,并采用宽松的Apache 2.0许可,这降低了开发者使用和二次开发的门槛。同时开放2.4T超大规模模型权重,为研究社区和商业应用提供了新的选择,可能推动多模态和长文本场景的落地。

AIHOT · X / 公众号精选/8月14日 15:02
65
20

模型dots3-note Preview 开源:280B 参数,支持长程智能体与多模态推理

筛选线索多模态开源模型与生态模型雷达1 个独立信源

dots3-note Preview 的开源为开发者提供了一个轻量且支持长上下文和多模态的模型选择,降低了长程智能体与多模态应用的门槛,可能推动相关领域的技术普及。

AIHOT · X / 公众号精选/8月14日 11:25
65
21

模型GLM-5.3发布:编程能力开源领先,涌现网络安全能力

筛选线索开源模型与生态模型雷达1 个独立信源

GLM-5.3在编程基准上取得开源第一并接近Claude Fable 5,表明国产开源模型在代码能力上已接近顶级闭源模型;同时新涌现的网络安全能力(白盒代码审查)为模型应用开辟了新的安全领域,可能改变企业选择开源模型的决策。

AIHOT · X / 公众号精选/8月14日 05:31
65
22

模型DeepSeek V4 Pro 登陆硅基流动,支持 1M 上下文

筛选线索开源模型与生态Agent 智能体模型家族模型雷达1 个独立信源

DeepSeek V4 Pro 上线硅基流动,提供 1M 上下文和分级推理强度,并保持开源,相比之前版本在上下文长度和任务侧重上有明显变化,可能影响开发者选择模型和部署方式。

AIHOT · X / 公众号精选/8月14日 04:55
65
23

模型Kimi-K3:开放权重多模态智能体模型

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。

Hugging Face Model Radar/6月13日 06:42
65
24

模型小红书开源连续自回归语音合成模型 dots.tts,定位可扩展 TTS 基座

筛选线索开源模型与生态语音与音频模型雷达1 个独立信源

此前 TTS 模型多采用离散 token 或非自回归架构,dots.tts 以连续端到端自回归方式实现更高准确度,且开源 20 亿参数模型,为行业提供可扩展的 TTS 基座,有望降低语音合成应用的门槛。

AIHOT · X / 公众号精选/8月13日 09:59
64
25

模型微软首发自研推理模型MAI-Thinking-1

筛选线索大模型与推理模型雷达1 个独立信源

这是微软首次推出自研推理模型,表明其不再仅依赖外部模型或合作,而是独立构建核心推理能力,标志着其在AI推理领域的战略布局进入新阶段。

AIHOT · X / 公众号精选/8月12日 16:00
64
26

模型DeepSeek V4 Flash 0731 开源,进入开源模型前三

筛选线索开源模型与生态模型家族开发者平台2 个独立信源

这是 DeepSeek 在开源模型领域的一次重要进展,模型性能进入开源前三,且采用 MIT 许可,降低了使用门槛。对于依赖开源模型的产品团队而言,多了一个高性能、低激活参数的选择,可能影响模型选型和成本结构。

多源确认
AIHOT · X / 公众号精选/7月31日 21:38
64
27

模型GLM-5.2 模型发布

筛选线索开源模型与生态AI 公司模型家族1 个独立信源

GLM-5.2 首次在开源模型中提供稳定的百万 token 上下文,推理能力(如数学竞赛 AIME 2026 得分 99.2)达到顶尖水平,相比前代 GLM-5.1 有质的飞跃。纯开源 MIT 许可消除了地域和技术获取障碍,使长上下文模型更易被开发者和企业采用。

Hugging Face Model Radar/6月16日 07:39
63
28

模型Ling-3.0-tiny 开源:1.3B 激活参数模型进入实际任务

筛选线索开源模型与生态大模型与推理模型雷达1 个独立信源

此前开源模型多在总参数量上竞争,而 Ling-3.0-tiny 强调推理时仅激活 1.3B 参数,总参数达 7.9B,这种“原生混合推理”设计有望在保持性能的同时降低推理成本,为小参数量模型的开源生态提供新思路。

AIHOT · X / 公众号精选/8月11日 09:20
63
29

模型腾讯混元发布 Hy ASR 3.0 preview:上下文感知的语音识别

筛选线索开源模型与生态大模型与推理开发者平台模型雷达1 个独立信源

腾讯混元推出 Hy ASR 3.0 preview,将语音识别与语义理解结合,支持上下文纠错和热词注入,相比传统 ASR 在准确性和场景适应性上有实质提升,尤其在粤语和高噪环境下表现突出,已落地腾讯云和元宝 App。

AIHOT · X / 公众号精选/8月4日 08:12
63
30

模型Meta 发布开源模型 Muse Glimmer,面向本地智能体工作流

筛选线索开源模型与生态Agent 智能体AI 主题模型雷达1 个独立信源

这是 Meta 在开源领域的一次新动作,其特点在于针对本地和常驻智能体工作流进行专门优化,而非通用任务。这一变化意味着开发者可能无需依赖云端 API,即可在消费级硬件上运行高性能智能体模型,降低了使用门槛,并可能影响智能体应用的开发模式。

AIHOT · X / 公众号精选/8月10日 10:13
63
上一页
1234
下一页