AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
2026年8月16日星期日

本期概览

7

约 5 分钟读完

新闻
3
论文
2
产品
0
模型
2
阅读本期日报

今日焦点

新基准测试证实 AI 模型视觉感知能力仍不佳

发生了什么
Moonshot AI 发布新基准测试 PerceptionBench,用于评估多模态 AI 模型的视觉感知能力,独立于逻辑推理。结果显示,目前没有任何前沿模型达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。许多原本被认为是推理错误的案例,实际在图像读取阶段就已出现。
为什么值得看
此前评估多模态模型时,常将错误归因于推理环节。PerceptionBench 将视觉感知与逻辑推理分离,揭示多数错误发生在早期图像读取阶段,这改变了人们对模型能力瓶颈的认知,有助于更精准地定位和解决基础感知问题。
新闻评分71类别:新闻来源:The Decoder AI News阅读全文
全部新闻论文产品模型

情报流

#Story为什么值得看类别评分
01

模型Inkling-Small:开放权重多模态模型上线

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。

Hugging Face Model Radar/7月27日 22:33
82
02

模型Qwen3.8-27B:新一代视觉语言模型发布

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

Qwen3.8 是开源 Qwen 系列最新一代,相比 Qwen3.5 和 3.6 在核心能力上有实质性提升,且 27B 为紧凑型稠密模型,易于部署,并原生支持图像视频,扩展了多模态应用场景,对开源社区和开发者有重要意义。

Hugging Face Model Radar/8月5日 08:22
79
03

模型Inkling:Hugging Face上新的通用多模态开放权重模型

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。

Hugging Face Model Radar/7月14日 13:23
78
04

模型Qwen 发布开源模型 Qwen3.8-2.4T-A95B

筛选线索开源模型与生态Agent 智能体AI 公司模型家族1 个独立信源

此前 Qwen-Max 级能力仅限闭源 API,本次 Qwen3.8-2.4T-A95B 将同类能力开源,使开发者可自行部署,降低了使用高性能模型的门槛,可能影响行业对开源与闭源模型的性能认知和选型。

Hugging Face Model Radar/8月8日 01:50
78
05

模型Muse-Glimmer-30B:面向消费硬件的代理模型

筛选线索多模态Agent 智能体AI 公司推理能力1 个独立信源

这是首个在消费级硬件上无需云端即可运行的、整合了完整代理能力(推理、工具调用、故障恢复)的 300 亿参数模型,可能改变了代理类应用的部署模式,降低了对云端的依赖。

Hugging Face Model Radar/8月9日 17:51
76
06

模型DeepSeek V4闪存版官方发布,智能体能力大幅增强

筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源

这是DeepSeek-V4-Flash从预览走向正式版的实质更新,模型智能体能力(如终端能力、代码生成)相较预览版本有巨大提升,部分基准超越同期Pro版本,但整体仍略逊于Opus-4.8,同时以更小规模达到接近顶级模型的水平。

Hugging Face Model Radar/7月31日 07:30
75
07

模型Ling-3.0-flash 模型发布

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

Ling-3.0-flash 以远小于前代旗舰模型的参数规模(活跃参数仅为前者的 8.1%)宣称达到同等或更优性能,且主打长上下文效率和生产环境部署能力,可能改变高效推理模型的竞争格局。

Hugging Face Model Radar/8月2日 16:14
74
08

模型Solar-Open2-250B模型:250B参数激活15B的百万token上下文开源大模型

筛选线索开源模型与生态Agent 智能体AI 公司大语言模型1 个独立信源

此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。

Hugging Face Model Radar/7月22日 02:40
73
09

模型ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token

筛选线索多模态大模型与推理AI 公司模型家族1 个独立信源

以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。

Hugging Face Model Radar/7月6日 13:16
71
10

模型Google DeepMind 发布 Gemini Robotics 2 物理 AI

筛选线索具身智能AI 主题AI 公司4 个独立信源

Gemini Robotics 2 是 DeepMind 最先进的视觉-语言-动作模型,提供全身智能、高级灵巧性和多机器人协作能力,相比此前仅能控制单一形态或简单动作的模型,它试图用一个通用大脑控制多种机器人,可能降低机器人的开发门槛。

多源确认
AIHOT · X / 公众号精选/7月31日 18:25
71
11

模型Nanbeige4.2-3B

筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源

该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。

Hugging Face Model Radar/7月21日 08:39
71
12

模型Mage-VL:编解码器原生流式多模态模型

筛选线索多模态大模型与推理AI 公司基础模型1 个独立信源

此前多模态模型多依赖预训练视觉编码器并均匀采样视频帧,导致实时流式感知时计算开销大、速度慢。Mage-VL 直接从零训练视觉编码器,并依据编解码器原理动态分配视觉标记,大幅减少标记数量,提升推理速度,为视频理解提供新的高效思路。

Hugging Face Model Radar/7月25日 08:29
69
13

模型腾讯Hy3:295B参数MoE模型,性能超越同尺寸开源模型

筛选线索开源模型与生态Agent 智能体AI 公司推理能力1 个独立信源

Hy3在Hy3 Preview基础上收集50+产品反馈并提升后训练数据质量,以21B激活参数达到更大模型的性能水平,降低部署成本同时增强agent能力,对中小规模AI应用落地意义重大。

Hugging Face Model Radar/7月2日 13:23
68
14

模型NVIDIA推出轻量化混合架构模型Nemotron-3.5-Lightning

筛选线索Agent 智能体AI 公司模型推理1 个独立信源

此模型主打长上下文和单卡部署,结合MoE与Mamba-2,对资源受限环境下的高效推理有实际意义,发布即热榜,且提供FP4量化版本。

Hugging Face Model Radar/8月4日 19:10
68
15

模型Laguna-S-2.1:面向智能体编程的118B MoE模型

筛选线索Agent 智能体AI 主题AI 公司1 个独立信源

与之前的 Laguna XS 2.1(33B-A3B)相比,Laguna-S-2.1 在激活参数相近的情况下提供了更大的总容量(118B),同时保持 1M 超长上下文和推理思考能力,且采用宽松许可证,降低了企业部署和定制门槛。

Hugging Face Model Radar/7月13日 13:58
68
上一页
1234
下一页