AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
2026年8月16日星期日

本期概览

7

约 5 分钟读完

新闻
3
论文
2
产品
0
模型
2
阅读本期日报

今日焦点

新基准测试证实 AI 模型视觉感知能力仍不佳

发生了什么
Moonshot AI 发布新基准测试 PerceptionBench,用于评估多模态 AI 模型的视觉感知能力,独立于逻辑推理。结果显示,目前没有任何前沿模型达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。许多原本被认为是推理错误的案例,实际在图像读取阶段就已出现。
为什么值得看
此前评估多模态模型时,常将错误归因于推理环节。PerceptionBench 将视觉感知与逻辑推理分离,揭示多数错误发生在早期图像读取阶段,这改变了人们对模型能力瓶颈的认知,有助于更精准地定位和解决基础感知问题。
新闻评分71类别:新闻来源:The Decoder AI News阅读全文
全部新闻论文产品模型

情报流

#Story为什么值得看类别评分
31

模型Scale AI 开源 Muse 系列模型

筛选线索开源模型与生态AI 主题模型雷达1 个独立信源

Scale AI 此前主要提供商业数据与模型服务,此次开源其智能体模型权重,降低了采用门槛,使开发者可在本地硬件部署,可能推动智能体技术的普及和竞争。

AIHOT · X / 公众号精选/8月10日 10:06
63
32

模型Agents‑A1:以 35B 参数智能体实现万亿参数级性能

筛选线索开源模型与生态Agent 智能体AI 主题AI 公司1 个独立信源

此前大模型性能提升主要依赖参数扩张,而 Agents‑A1 证明:通过横向扩展智能体能力(长程任务、多领域工具调用),较小的 MoE 模型也能达到同等效果,可能重塑模型研发成本与部署策略。

Hugging Face Model Radar/6月22日 02:22
62
33

模型OpenAI推出两款新转录模型API

筛选线索AI 公司模型家族1 个独立信源

此前OpenAI的转录模型(如Whisper)未明确区分实时与批量场景,新模型专攻两种方向,且声称在口音、噪音等复杂条件下有显著准确率提升,这将直接影响语音应用的字准率与用户体验。

AIHOT · X / 公众号精选/7月28日 20:26
62
34

模型DeepSeek-V4-Flash API公测,Agent能力提升

筛选线索AI 编码模型家族开发者平台1 个独立信源

V4-Flash在Agent能力上超越V4-Pro-Preview,且原生支持Responses API和Codex适配,降低了开发者集成门槛,可能促使更多Agent类应用采用该模型。

AIHOT · X / 公众号精选/7月31日 06:56
61
35

模型Unlimited-OCR 模型发布:推动一次性长视界OCR解析

筛选线索多模态AI 公司模型家族1 个独立信源

相比以往需分块处理的 OCR 模型,Unlimited-OCR 宣称支持一次性长视界解析,可能降低复杂文档(如长合同、书籍)的多步预处理成本,提升整体处理效率。

Hugging Face Model Radar/6月19日 09:40
61
36

模型Kimi K2.7 Code 编码代理模型

筛选线索多模态Agent 智能体AI 公司模型家族1 个独立信源

该模型相比前代 K2.6 在编码代理能力上有实质性提升,同时显著降低了推理时的思考 token 消耗,这意味着在复杂软件工程任务中可更高效地使用模型,降低算力成本。

Hugging Face Model Radar/6月11日 07:51
60
37

模型Qwen-Image-3.0-Pro 上线 Qwen Cloud

筛选线索图像生成模型家族模型雷达1 个独立信源

Qwen-Image-3.0 发布并上线云平台,标志着阿里在文生图领域达到中国领先、国际主流水准,且提供 API 定价,意味着开发者可直接使用该能力,推动应用落地。

AIHOT · X / 公众号精选/8月5日 02:40
60
38

模型OpenRouter 上线 FLUX 3 Video 统一多模态模型

筛选线索图像生成多模态AI 主题模型雷达1 个独立信源

此前多模态模型多针对单模态或简单组合,此次 FLUX 3 Video 在 OpenRouter 平台向所有人开放,提供一个基础上同时覆盖视频、音频、图像和动作预测的统一模型家族,降低了多模态应用开发的接入门槛。

AIHOT · X / 公众号精选/8月4日 17:54
60
39

模型商汤开源 SenseNova U1:统一推理与图像生成

筛选线索图像生成多模态模型雷达1 个独立信源

以往推理与图像生成通常由不同模型或流程完成,SenseNova U1 将两者统一,可能简化多模态任务的处理方式,降低集成复杂性,并提高内容生成的连贯性。

AIHOT · X / 公众号精选/8月4日 15:46
60
40

模型蚂蚁百灵发布Ling-3.0-flash开源权重

筛选线索开源模型与生态模型雷达1 个独立信源

此前蚂蚁百灵可能未开放该模型权重,此次开源并同时提供两种量化版本,意味着开发者可以自部署,降低对封闭API的依赖,扩展了模型的可及性和应用灵活性。

AIHOT · X / 公众号精选/8月4日 15:03
60
41

模型商汤发布SenseNova U1.5-Lite-Preview开源模型

筛选线索多模态开源模型与生态模型雷达1 个独立信源

商汤发布轻量级开源模型,以8B参数实现接近闭源商业模型的多模态生成与编辑质量,可能降低高质量多模态模型的使用门槛,并加剧开源与闭源模型的竞争。

AIHOT · X / 公众号精选/8月3日 14:40
59
42

模型MiniMax H3正式开源,支持2K视频与原生立体声的全模态生成系统

筛选线索多模态开源模型与生态模型雷达1 个独立信源

此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。

AIHOT · X / 公众号精选/8月3日 02:44
59
43

模型Inkling-Small 发布,276B 参数性能持平原版

筛选线索大模型与推理模型雷达1 个独立信源

Inkling-Small 以四分之一的总参数规模实现与原版相当的性能,且仅需 12B 激活参数,意味着在保持性能的同时大幅降低了资源消耗。这标志着高效模型在保持能力上取得进展,可能推动大模型在更广泛场景的部署。

AIHOT · X / 公众号精选/7月30日 17:47
58
44

模型Kimi K3 上线 Modal,支持无损加速推理

筛选线索模型家族模型雷达1 个独立信源

此前推理速度提升常伴随质量下降,K3 通过自定义 DFlash 投机器同时实现加速和质量无损,标志着推理效率的重要进步。

AIHOT · X / 公众号精选/7月27日 15:44
57
45

模型Kimi K3 发布:开源模型权重、技术报告及三项Infra技术

筛选线索开源模型与生态大模型与推理模型家族模型雷达1 个独立信源

2.8万亿参数规模是国产大模型的显著突破,原生视觉理解与100万token上下文窗口大幅扩展应用场景;规模化效率提升2.5倍意味着相同算力下可处理更多任务,开源权重与Infra技术降低复现和二次开发门槛。

AIHOT · X / 公众号精选/7月27日 15:34
57
上一页
1234
下一页