AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期周报

第 33 周202624第 32 周202624第 31 周202624第 30 周202622第 29 周202624
返回情报流
AILORE SIFTWEEKLY · 2026.W29

AI 周报

2026 年第 29 周

本期重点
24
预计阅读
13 分钟

本周AI领域呈现多重结构性变化:开放权重多模态模型(Inkling)、超长上下文模型(GLM-5.2)及高效推理模型(ThinkingCap、Hy3)集中涌现,推动部署门槛下降;企业端AI采纳从试点转向规模化,三星、BBVA、MUFG等巨头全员部署ChatGPT;OpenAI联合Broadcom推出定制推理芯片Jalapeño,红队系统GPT-Red实现自博弈安全改进。产品侧,AI代理渗透至测试、医疗、股权管理、工作流等垂直场景。论文研究聚焦代理效率(E3框架)、治理(Traccia)及前瞻记忆评估(PM-Bench),多模态生成与推理能力持续提升。

01模型进展602产品与商业603行业动态604论文研究6
00

PERIOD HIGHLIGHTS

本期看点

  1. 01Inkling:Hugging Face上新的通用多模态开放权重模型模型
  2. 02ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token模型
  3. 03腾讯Hy3:295B参数MoE模型,性能超越同尺寸开源模型模型
  4. 04GLM-5.2 模型发布模型
  5. 05Agents‑A1:以 35B 参数智能体实现万亿参数级性能模型
01

MODEL RADAR

模型进展

6 条

多模态开放权重模型Inkling、能力对标万亿参数规模的Agents‑A1、长上下文旗舰GLM-5.2(1M token)、高效推理ThinkingCap(减少50%思考token)及295B MoE模型Hy3等密集发布,共同推动模型在性能、效率与开源可及性上的突破。

Hugging Face Model Radar1

Inkling:Hugging Face上新的通用多模态开放权重模型

2026年7月14日,Hugging Face上出现名为Inkling的多模态模型,支持文本、图像和音频输入,输出文本。该模型为66层decoder-only transformer架构,使用稀疏Mixture-of-Experts,每token激活6个专家和2个共享专家。开放权重,支持多种本地部署库和第三方API,适用于聊天、代码助手、RAG等场景。

为什么值得看Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。
Hugging Face Model Radar1

ThinkingCap-Qwen3.6-27B:基于Qwen3.6微调减少50%思考token

ThinkingCap-Qwen3.6-27B是一个基于Qwen3.6-27B微调的模型,平均减少50%的思考token,最佳案例减少90%以上。在GPQA-Diamond、MMLU-Pro等多个基准测试中,准确率基本持平或略有提升,同时大幅降低了推理所需的token数量。

为什么值得看以往推理模型为提高准确性往往需要大量思考token,ThinkingCap通过微调在不牺牲质量的前提下大幅压缩token,使模型在保持性能的同时显著提升推理速度并降低成本。
Hugging Face Model Radar1

腾讯Hy3:295B参数MoE模型,性能超越同尺寸开源模型

腾讯Hy团队发布Hy3模型,总参数295B,激活参数21B,采用MoE架构,支持256K上下文。性能优于同尺寸模型,可媲美参数2-5倍的旗舰开源模型,在agent能力和产品可靠性方面有显著提升。

为什么值得看Hy3在Hy3 Preview基础上收集50+产品反馈并提升后训练数据质量,以21B激活参数达到更大模型的性能水平,降低部署成本同时增强agent能力,对中小规模AI应用落地意义重大。
Hugging Face Model Radar1

GLM-5.2 模型发布

GLM-5.2 在 Hugging Face 上发布,是一款长视野任务旗舰模型,首次实现稳定 1M token 上下文,并通过 IndexShare 架构将每 token FLOPs 降低 2.9 倍,MTP 层提升推测解码接受长度 20%。模型采用 MIT 开源许可,无地域限制。基准测试中,GLM-5.2 在 AIME 2026 上达到 99.2,在 HLE 上为 40.5(使用工具 54.7),在 CritPt 上为 20.9,均超越前代 GLM-5.1 并接近或超过部分竞品。当前热度分 230,点赞 4063,下载 534698。

为什么值得看GLM-5.2 首次在开源模型中提供稳定的百万 token 上下文,推理能力(如数学竞赛 AIME 2026 得分 99.2)达到顶尖水平,相比前代 GLM-5.1 有质的飞跃。纯开源 MIT 许可消除了地域和技术获取障碍,使长上下文模型更易被开发者和企业采用。
Hugging Face Model Radar1

Agents‑A1:以 35B 参数智能体实现万亿参数级性能

返回情报流后一期

InternScience 团队于 2026 年 6 月开源了 Agents‑A1,这是一个 35B 参数的混合专家智能体模型。它通过扩展长程任务轨迹和异构能力(涵盖搜索、工程、科研、指令遵循与工具调用)而非单纯增大参数规模,达到了可与万亿参数模型媲美的性能。后续还将发布 4B 量化版本以支持本地部署。

为什么值得看此前大模型性能提升主要依赖参数扩张,而 Agents‑A1 证明:通过横向扩展智能体能力(长程任务、多领域工具调用),较小的 MoE 模型也能达到同等效果,可能重塑模型研发成本与部署策略。
Hugging Face Model Radar1

Unlimited-OCR 模型发布:推动一次性长视界OCR解析

Unlimited-OCR 模型于 2026 年 6 月在 Hugging Face 发布,定位为一次性长视界解析模型,旨在推进 Deepseek-OCR。该模型获得 2025 点赞、208 万下载,热度分 86。支持 vLLM、SGLang 等推理框架,提供 Docker 镜像,并已在百度云和 ModelScope 上可使用。论文已公开。

为什么值得看相比以往需分块处理的 OCR 模型,Unlimited-OCR 宣称支持一次性长视界解析,可能降低复杂文档(如长合同、书籍)的多步预处理成本,提升整体处理效率。
02

PRODUCT

产品与商业

6 条

Manta AI(Web测试)、ChikitAI(医疗分诊)、Clerk(股权管理)、Unabyss for Claude(跨应用记忆)、Kimi K3(3T级开源)及Albato AI(跨应用工作流)等产品涌现,AI代理正加速渗透至专业垂直领域与自动化场景。

Product Hunt1

Manta AI:自主 Web 应用测试代理

Manta AI 是一款在 Product Hunt 上发布的 AI 代理产品,其功能是自主执行 Web 应用的测试任务。

为什么值得看Manta AI 将 AI 代理用于 Web 应用测试,可能改变传统测试依赖手工或脚本的方式,推动测试流程的自主化。
Product Hunt1

ChikitAI——用于医疗分诊和护理自动化的智能体AI

ChikitAI是一款面向医疗分诊和护理自动化的智能体AI产品,于2026年7月14日出现在Product Hunt平台,其描述为“用于医疗分诊和护理自动化的智能体AI”。

Product Hunt1

Clerk:面向股权结构表的 AI 助手

2026年5月5日,Product Hunt 上发布了名为 Clerk 的 AI 助手,专为股权结构表(Cap Tables)管理设计。它支持发放股权授予、模拟融资轮次,并能回答任何与股权相关的问题。

为什么值得看此前股权管理依赖手动表格或复杂软件,Clerk 通过自然语言交互降低了操作门槛,使创始人能更快完成股权授予和融资建模,减少错误。
Product Hunt1

Unabyss for Claude 跨应用与 LLM 共享记忆

Unabyss 发布了一款名为 Unabyss for Claude 的产品,该产品能够在 Claude 中实现跨所有应用和大语言模型的共享记忆功能。

为什么值得看此前 Claude 等大语言模型通常缺乏跨应用和跨模型的持久记忆能力,Unabyss 的共享内存功能让用户在不同应用场景下保持上下文连贯,可能改变 AI 交互的连续性体验。
Product Hunt1

Kimi K3:世界首个开放 3T 级模型

Kimi K3 在 Product Hunt 上发布,其宣传语为“世界首个开放 3T 级模型”。目前尚无独立验证或详细技术参数。

为什么值得看若属实,这将是首个公开宣称达到 3T 参数规模的开源模型,此前主流开源模型参数多停留在数百 B 级别,可能拉开开源大模型的新参数量级。
Product Hunt0

Albato AI:跨 1000 多个应用构建 AI 驱动工作流

Albato AI 是一款在 Product Hunt 上发布的产品,宣称可在超过 1000 个应用中构建 AI 驱动的工作流,以简化自动化流程。

为什么值得看相比传统无代码自动化工具,Albato AI 引入了 AI 能力,使得工作流可以基于语义或推理而非固定规则触发,可能降低复杂自动化场景的搭建门槛。
03

INDUSTRY

行业动态

6 条

OpenAI与Broadcom推出定制推理芯片Jalapeño,三星、BBVA、MUFG等巨头全员部署ChatGPT Enterprise,HP启动Frontier合作,GPT-Red实现自动红队自我改进,标志着AI基础设施定制化、企业级规模化部署及安全自演化进入新阶段。

OpenAI News1

OpenAI和Broadcom推出面向LLM推理的定制芯片Jalapeño

OpenAI与芯片公司Broadcom联合发布了一款名为Jalapeño的定制AI芯片,该芯片专为大语言模型(LLM)推理任务设计,旨在提升性能、效率和系统规模化能力。

为什么值得看这是首个由领先AI模型开发商与半导体厂商合作推出的专用推理芯片,标志着推理基础设施从通用GPU转向定制化硬件,可能改变AI部署的成本和性能格局。
OpenAI News1

三菱日联金融集团目标借助OpenAI成为AI原生企业

三菱日联金融集团(MUFG)宣布通过使用ChatGPT Enterprise构建AI原生组织,旨在改进内部工作流程,并大规模推出由AI驱动的新型金融服务。

为什么值得看一家大型传统银行公开宣布全面采用企业级ChatGPT,从内部流程优化到对外服务创新,标志着金融机构对生成式AI的深度采纳进入规模化阶段。
OpenAI News1

BBVA将AI置于银行业务核心,与OpenAI合作

BBVA将ChatGPT Enterprise推广至10万名员工,并与OpenAI合作,旨在加速全球范围内以AI驱动的银行业务转型。

为什么值得看此前银行业AI应用多限于局部试点,BBVA将ChatGPT Enterprise大规模部署至全员,标志着大型银行在AI深度融入核心运营方面迈出实质性一步。
OpenAI News1

三星电子向员工推出ChatGPT和Codex

三星电子在全球范围内向员工部署ChatGPT Enterprise和Codex,成为OpenAI最大规模的企业级AI部署之一。此举标志着大型科技公司全面引入生成式AI工具。

为什么值得看此前多数企业仅小规模测试AI工具,三星作为全球消费电子巨头,一次性面向全体员工部署,可能加速企业级AI应用的普及和规范化。
OpenAI News1

GPT-Red:用自我改进提升鲁棒性

OpenAI发布了GPT-Red,这是一个自动红队系统。该系统通过自我对弈方式,让模型生成对抗性输入并测试自身,从而提升AI模型的安全性、对齐能力和对提示注入攻击的鲁棒性。

为什么值得看此前红队测试主要依赖人工或外部系统,GPT-Red实现了自动化自我对弈,可能使AI安全改进更高效、持续,降低对人力的依赖。
OpenAI News1

HP Inc. 与 OpenAI 启动 Frontier 战略合作伙伴关系

HP Inc. 于2026年6月28日宣布扩大与OpenAI的Frontier战略合作伙伴关系,将AI部署到客户体验、软件开发和企业运营三个领域。

为什么值得看此次合作将AI部署范围扩展至客户体验、软件开发和运营,意味着企业级AI应用从局部试点向多核心流程渗透,可能改变HP在打印、PC等业务的智能化策略。
04

RESEARCH

论文研究

6 条

E3框架以85%成本降幅实现代理100%成功率;Traccia利用OpenTelemetry自动生成EU AI Act合规证据包;Boogu-Image-0.1接近闭源生成水平;SD-MAR通过强化学习提升多图像推理;PM-Bench揭示代理前瞻记忆仅为65.1% F1,凸显关键瓶颈。

arXiv AI1

AI代理能否判断任务简单性?面向复杂度感知的推理与执行

一篇arXiv论文指出,当前的大语言模型(LLM)代理在执行任务时往往采用最大上下文优先策略,导致大量冗余计算。研究者提出E3框架(估计、执行、扩展),通过先评估任务难度,执行最小可行路径,仅在验证失败时逐步扩大范围。在MSE-Bench基准测试中,E3在保持100%成功率的同时,将成本降低85%、token消耗降低91%、检查文件数减少92%,并击败了另一自适应基线16%。在真实gpt-4o代理编辑开源库的测试中,E3同样是最精简和最快的策略。

为什么值得看此前LLM代理无法识别任务实际所需的努力,往往无差别地读入所有上下文,造成大量浪费。E3首次引入了任务感知的执行范围估计,用最小资源完成正确操作,在成功率不变的前提下大幅降低了计算成本,为AI代理的实用化提供了重要的效率优化方向。
arXiv AI1

Traccia:基于OpenTelemetry的AI系统治理平台

arXiv论文提出Traccia,一个基于OpenTelemetry的AI系统治理平台。它通过添加遥测数据、被动语义护栏评估和执行血统记录到哈希跟踪账本,自动生成抗篡改合规证据包(含SHA-256哈希),映射欧盟AI Act第12、14、19、26(6)、50条的要求,且不侵犯数据隐私。该方案旨在解决现有碎片化LLM评估和监控工具无法保护无界状态空间代理架构免受对齐漂移、SaaS安全威胁和影子AI等问题。

为什么值得看此前AI治理工具碎片化,无法应对代理架构特有的对齐漂移、影子AI等威胁。Traccia首次将OpenTelemetry遥测、语义护栏和执行血统整合为统一哈希追溯层,自动输出符合EU AI Act的合规证据包,为自主AI系统的企业级管理提供了可审计的机器可读基础。
arXiv AI1

Boogu-Image-0.1:提升开源统一多模态理解与生成能力

开源多模态模型系列Boogu-Image-0.1发布,包含Base、Turbo、Edit和Edit-Turbo四个变体。该系列在高质量文本到图像生成、快速推理、基于指令的编辑以及中英双语文本渲染方面表现优异,标准测试中匹配或超越其他开源模型,并接近Nano-Banana-Pro和GPT-Image-2等闭源系统。基础模型仅使用2.0862亿张独特图像,理论训练成本约40万美元,权重、代码和配方以Apache 2.0协议开源。

为什么值得看此前开源统一多模态模型在生成质量和速度上普遍落后于闭源系统,Boogu-Image-0.1证明在有限算力下通过优化数据质量、训练管道和推理时缩放即可达到接近闭源产品的水平,且完全开源,降低了高端图像生成与编辑模型的使用和定制门槛。
arXiv AI1

SD-MAR:通过合成数据和强化学习实现多图像分析推理

SD-MAR是一个用于训练和评估视觉语言模型多图像分析推理的框架。它通过控制扰动构造成对视觉场景,生成语义变化归因和定量比较等推理任务,并使用GRPO-lite与BDA强化学习方法训练。在Qwen2.5-VL-7B和InternVL3-8B上,域内准确率提升高达36.95%,其中Qwen2.5-VL-7B在SD-MAR基准上超越GPT-4.1,且域外泛化性能保持或提升(MME、MMMU-Pro、MathVista波动在1%以内,MMBench提升最高4%)。

为什么值得看此前视觉语言模型虽具备感知能力,但在多图像比较、变化检测和多步视觉推理等需要分析推理的任务上表现有限。SD-MAR通过合成数据和专门设计的强化学习方法,显著提升了这类能力,甚至超越GPT-4.1,且不损害原有任务表现,为实际应用中的视觉对比分析提供了可行方案。
arXiv AI1

PM-Bench:评估LLM代理的前瞻记忆能力

论文团队发布PM-Bench,一个基于文本的基准测试,用于评估LLM代理的前瞻记忆能力。该基准测试模拟为期七天的虚拟周,要求代理在持续活动的同时执行延迟任务。测试了8个最先进LLM在8种配置下的表现,最佳方法(GPT-5.4代理)仅达到65.1% F1分数。结果说明前瞻记忆是当前AI代理的重大挑战,且没有单一策略占主导。

为什么值得看此前缺乏专门评估LLM代理前瞻记忆的系统基准。PM-Bench首次从认知科学引入虚拟周范式,量化了代理在持续活动中执行延迟意图的能力,结果发现所有模型均表现不佳,表明这一能力是关键瓶颈,需要针对性改进。
arXiv AI1

生成式AI能否取代监督XMLC?基于德国科学文献自动主题索引的基准研究

德国国家图书馆(DNB)针对当代德文科学文献的自动主题索引任务,对比了监督型极端多标签分类(XMLC)方法与基于大语言模型(LLM)的生成方法。结果显示监督XMLC在整体二元相关指标上最优,但LLM方法在分级相关性和长尾词汇表现更好,被视作未来生产应用的有前途替代方案。

为什么值得看此前自动主题索引主要依赖监督XMLC或词典匹配。本研究首次系统对比LLM生成方法与传统XMLC,发现LLM虽整体精度略低,但在长尾词汇和分级相关性上显著超越传统方法,为实际部署提供了互补路径。