AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期周报

第 33 周202624第 32 周202624第 31 周202624第 30 周202622第 29 周202624
返回情报流
AILORE SIFTWEEKLY · 2026.W31

AI 周报

2026 年第 31 周

本期重点
24
预计阅读
16 分钟

本周AI领域呈现多维突破:开源模型迎来3T级多模态智能体Kimi K3,Google发布高效新模型降低推理成本,小红书dots模型在IMO取得满分,标志着非形式化数学推理能力质的飞跃。产品侧,ChatGPT切入健康数据场景并推出语音多智能体,Rivault引入生物识别授权,提升安全与个性化水平。行业动态显示AI商业化加速,Google Cloud增长82%带动营收,微软自研安全模型降低成本但复杂推理仍依赖外部,Anthropic Opus 5在逻辑基准上大幅领先。论文方面,LLM在规则评估中存在系统性漏洞,事实核查动态评估未消除污染,第三方API路由带来严重安全风险,同时新框架如Molt和隐式控制优化了训练与推理效率。整体趋势聚焦能力突破、商业落地、安全可控与可靠验证。

01模型进展602产品与商业603行业动态604论文研究6
00

PERIOD HIGHLIGHTS

本期看点

  1. 01Inkling-Small:开放权重多模态模型上线模型
  2. 02Kimi-K3:开放权重多模态智能体模型模型
  3. 03Google DeepMind 发布 Gemini Robotics 2 物理 AI模型
  4. 04OpenAI推出两款新转录模型API模型
  5. 05DeepSeek V4 Flash 0731 开源,进入开源模型前三模型
01

MODEL RADAR

模型进展

6 条

开放权重模型Kimi K3以2.8T参数和100万窗口开创3T级开源智能体;Google 3.6 Flash编码token降低65%,3.5 Flash-Lite达350 token/秒;小红书dots非形式化应对IMO满分;通义Qwen-Audio双版本登顶TTS榜单,支持多语言方言;Kimi K3实现无损加速推理,效率显著提升。

Hugging Face Model Radar1

Inkling-Small:开放权重多模态模型上线

Inkling-Small 是 Hugging Face Trending 上的一个多模态模型,支持文本、图像和音频输入并生成文本,采用 42 层解码器架构和稀疏 MoE(每 token 路由到 6/256 专家)。该模型发布于 2026-07-27,热度分 213,点赞 213,下载 3998,提供开放权重,支持 SGLang、vLLM 等本地部署。

为什么值得看此模型热度与下载量显示开发者对多模态开放权重模型的兴趣,其稀疏 MoE 架构可能提升推理效率,对应用开发有潜在影响。
Hugging Face Model Radar1

Kimi-K3:开放权重多模态智能体模型

基于Hugging Face Trending上发布的Kimi K3模型介绍,该模型是一个开放权重的原生多模态智能体模型,参数量2.8T,采用Kimi Delta Attention和Attention Residuals架构,支持100万token上下文窗口,是世界首个开放的3T级模型,具备长时编码、智能知识工作等能力。

为什么值得看这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。
AIHOT · X / 公众号精选1

Google DeepMind 发布 Gemini Robotics 2 物理 AI

Google DeepMind 于 2026 年 7 月 30 日发布下一代物理 AI 模型 Gemini Robotics 2,它是一个视觉-语言-动作模型,旨在控制从桌面机械臂到全尺寸仿人机器人的多种形态。该系列共包含三个模型,目前仅有一个公开可用。同时发布的 Gemini Robotics ER 2 增加了高层推理层,用于机器人任务。

为什么值得看Gemini Robotics 2 是 DeepMind 最先进的视觉-语言-动作模型,提供全身智能、高级灵巧性和多机器人协作能力,相比此前仅能控制单一形态或简单动作的模型,它试图用一个通用大脑控制多种机器人,可能降低机器人的开发门槛。
AIHOT · X / 公众号精选1

OpenAI推出两款新转录模型API

OpenAI在API中发布了两款新的转录模型:GPT-Live-Transcribe用于低延迟实时转录,GPT-Transcribe用于异步批量转录。两者均能更好地理解上下文,在处理口音、语言、短句、数字、专业术语及背景噪音时提供更准确的转录。

为什么值得看此前OpenAI的转录模型(如Whisper)未明确区分实时与批量场景,新模型专攻两种方向,且声称在口音、噪音等复杂条件下有显著准确率提升,这将直接影响语音应用的字准率与用户体验。
AIHOT · X / 公众号精选1

DeepSeek V4 Flash 0731 开源,进入开源模型前三

前一期返回情报流后一期

DeepSeek 于 2026 年 7 月 31 日发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。Product Hunt 上以“Flash 价格的边缘代理智能”为宣传语介绍该模型。

为什么值得看这是 DeepSeek 在开源模型领域的一次重要进展,模型性能进入开源前三,且采用 MIT 许可,降低了使用门槛。对于依赖开源模型的产品团队而言,多了一个高性能、低激活参数的选择,可能影响模型选型和成本结构。
AIHOT · X / 公众号精选1

DeepSeek-V4-Flash API公测,Agent能力提升

DeepSeek-V4-Flash官方API于2026年7月31日公测上线。官方称其Agent能力大幅升级,基准测试分数已超过V4-Pro-Preview。新版原生支持Responses API格式,并已适配Codex,配置详情见官方API文档。

为什么值得看V4-Flash在Agent能力上超越V4-Pro-Preview,且原生支持Responses API和Codex适配,降低了开发者集成门槛,可能促使更多Agent类应用采用该模型。
02

PRODUCT

产品与商业

6 条

ChatGPT连接Apple Health与医疗记录,提供个性化健康追踪;桌面版支持语音控制多智能体并行操作;Rivault以Face ID授权代理数据访问,增强安全控制;Claude Cowork录制屏幕+语音自动生成技能;Kimi发布PerceptionBench,基于失败模式拆解原子视觉能力。

AIHOT · X / 公众号精选1

OpenRouter 下调 GPT-5.6 Terra/Luna 价格

OpenRouter 宣布下调 OpenAI GPT-5.6 Terra 和 Luna 模型的价格,在 OpenAI 官方降价基础上,OpenRouter 提供 50% 独家折扣,使 Luna 输入降至 0.1 美元/M、输出降至 0.6 美元/M,Terra 输入降至 1 美元/M、输出降至 6 美元/M,并引导用户使用 Luna 扩展工作负载。

为什么值得看相比 OpenAI 官方降价,OpenRouter 通过额外折扣进一步拉低调用成本,尤其将 Luna 输出价格压至 0.6 美元/M,可能显著降低高用量场景的 API 支出,使开发者更有动力迁移到更小或更便宜模型。
AIHOT · X / 公众号精选1

ChatGPT 向美国用户推出健康功能,可连接 Apple Health

OpenAI 宣布向美国用户推出 ChatGPT 健康功能,可安全连接 Apple Health 及受支持的医疗记录,使 ChatGPT 能理解用户的个人健康上下文,追踪健康变化并提供更个性化的帮助。

为什么值得看以前 ChatGPT 只能基于通用知识回答健康问题,现在能接入用户个人健康数据,提供基于上下文的个性化建议,这是健康咨询体验的实质性变化。
AIHOT · X / 公众号精选1

OpenAI 为学术研究者免费提供前沿模型

OpenAI 推出了 ChatGPT for Academic Researchers 项目,面向数学家、科学家、研究人员和学者免费提供其前沿模型(包括 GPT-5.6-Sol Pro),旨在帮助学术群体解决未解难题。

为什么值得看这标志着 OpenAI 首次将最前沿模型免费开放给学术研究群体,改变了以往需要付费或使用旧模型的局面,大幅降低了学术研究利用前沿 AI 的成本门槛。
AIHOT · X / 公众号精选1

ChatGPT桌面版推出语音控制多智能体功能

ChatGPT桌面版(macOS/Windows)新增语音控制多智能体功能。用户通过语音即可指挥在ChatGPT Work或Codex中运行的多个智能体协同工作。该功能由GPT-Live驱动,支持实时说话、聆听与协调。即日起面向Plus、Pro、Business、Edu及Enterprise计划用户全球推送。

为什么值得看此前语音交互多限于单轮问答,如今用户可语音操控多个专业智能体并行完成复杂任务(如代码编写、文档处理),极大降低多任务协作的操作门槛,提升桌面端效率。
Product Hunt1

Rivault:用 Face ID 批准 AI 代理数据访问

Rivault 是一个在 Product Hunt 上发布的产品,允许用户通过 Face ID 生物识别来批准 AI 代理对其数据的访问请求。它解决的是 AI 代理获取用户数据时的授权问题,将传统的密码或预先授权方式替换为快速的人脸验证,从而降低安全摩擦。

为什么值得看以往 AI 代理访问用户数据需要提前设置权限或手动输入密码,操作繁琐且容易中断流程。Rivault 将批准环节简化为一次 Face ID 验证,使得实时授权更自然、更安全,可能改变 AI 应用与用户数据交互的体验。
AIHOT · X / 公众号精选1

OpenAI 推出 Codex 安全 CLI 与 SDK

OpenAI 发布了一款开源 CLI 和 TypeScript SDK,名为 Codex 安全工具,用于自动查找、验证和修复代码安全漏洞。它支持扫描仓库、审查变更、随时间追踪发现,并可在 CI 流水线中运行安全检查。

为什么值得看此前安全扫描工具多为独立服务或需手动配置,Codex 安全工具直接集成到开发工作流中,将 AI 能力应用于漏洞检测与修复,降低了使用门槛并加速了安全自动化。
03

INDUSTRY

行业动态

6 条

Anthropic与Cognizant深化合作,加速企业Claude部署;微软自研MAI-Cyber-1-Flash降低安全成本,但复杂任务仍依赖OpenAI;Alphabet Q2营收增24%,Gemini月活9.5亿、API 220亿token/分钟;Kimi K3开源但独立测试发现网络安全与数学短板;Claude Opus 5在ARC-AGI-3创30.2%记录,首次独立推导反射方程,逻辑推理飞跃。

The Decoder AI News1

OpenAI 开源 Codex Security CLI,从命令行发现并修复代码漏洞

OpenAI 宣布开源 Codex Security CLI,这是一个命令行工具,能够自动检测和修复代码库中的安全漏洞。该工具此前内部代号为“Aardvark”,已帮助修复超过3000个关键安全缺陷。目前它直接与 Anthropic 的 Claude Security 竞争,两家公司均试图通过 AI 驱动防御来匹配不断增长的自动化网络攻击。

为什么值得看此前安全扫描工具多为闭源或集成在云端,Codex Security CLI 以开源形式发布,使开发者可直接在本地与 CI/CD 流程中免费使用,降低了安全检测门槛;同时表明 OpenAI 与 Anthropic 在 AI 安全领域正进行直接产品竞争。
OpenAI News1

OpenAI 发布 GPT-5.6,降低 Luna 和 Terra 定价以提升性价比

OpenAI 于2026年7月30日发布新闻,宣布推出 GPT-5.6,并针对 Luna 和 Terra 两个版本下调价格,同时强调更高效的模型有助于企业大规模部署 AI 工作流。

为什么值得看此次发布表明 OpenAI 在追求性能提升的同时,开始重点优化成本结构。降价举措直接降低了企业采用大模型的成本门槛,可能促使更多企业将 AI 工作流投入生产环境,改变市场对 GPT 系列定价的预期。
Anthropic News1

Cognizant与Anthropic扩大合作,将Claude带给企业客户

2026年7月27日,Anthropic宣布与Cognizant扩大合作伙伴关系,旨在将Claude模型引入企业客户。合作的重点是让企业更容易采用Claude。

为什么值得看Cognizant作为大型IT服务商,其与Anthropic的深化合作意味着Claude在企业级市场的推广渠道进一步拓宽,可能加速企业AI应用落地。此前合作仅停留在试点或有限范围,此次扩展标志着更广泛的商业化部署。
The Decoder AI News1

微软发布自研网络安全模型MAI-Cyber-1-Flash,最严峻任务仍依赖OpenAI

微软发布了自研的紧凑型网络安全模型MAI-Cyber-1-Flash,嵌入MDASH多智能体系统后,在CyberGym基准测试中得分96%。相比纯前沿模型,成本预计降低50%,因为仅将复杂任务转发给OpenAI的GPT-5.4处理。微软在复杂推理任务上仍依赖OpenAI。

为什么值得看此前微软在网络安全领域高度依赖OpenAI的模型,现在通过自研紧凑模型可处理大部分场景,成本显著下降,但复杂推理仍依赖外部,表明微软在关键任务上尚未完全自立。
AIHOT · X / 公众号精选1

Alphabet Q2 营收增 24%,Gemini 月活达 9.5 亿

Alphabet Q2 营收同比增长 24%,Google Cloud 增速达 82%。Gemini 应用月活跃用户达 9.5 亿,模型 API 处理量升至 220 亿 token/分钟,由 Flash 模型驱动。Gemini Enterprise 已被 90% 的财富 100 强企业采用。

为什么值得看相比此前谷歌 AI 产品的商业化进展,Gemini 月活从起步跃升至 9.5 亿,API 处理量达到 220 亿 token/分钟,且头部企业采纳率极高,说明 AI 投资已迅速转化为规模化用户和营收增长。
The Decoder AI News1

Moonshot AI 发布 Kimi K3 开放权重与基础设施

中国AI公司Moonshot AI发布了Kimi K3的模型权重并开源了部分基础设施。该模型在常见基准测试中接近西方前沿模型如Fable 5和GPT-5.6 Sol,但独立测试发现其在网络安全和数学性能上存在明显差距,可能源于蒸馏。

为什么值得看Kimi K3是少数接近前沿水平的中国开源模型之一,其开放权重可能降低开发者获取高质量模型的成本,但独立测试揭示的性能差距提示用户需谨慎评估。
04

RESEARCH

论文研究

6 条

前沿LLM在嵌套规则评估中出现“异常链崩溃”且准确性无通知漂移,神经符号方案提升准确率;多模态事实核查动态评估污染未消除,Macro-F1虚高超11分;NVIDIA发布Molt框架简化智能体RL迭代;Skill-SP框架通过技能共进化实现自动验证;第三方API路由器缺乏执行一致性验证,代理防御成功率0%;多头隐式控制从隐状态生成部署控制,减少大模型调用超90%。

arXiv AI1

用于自主量子传感实验科学推理的智能体AI

研究人员实现了一种基于大语言模型代理的自主实验工作流,用于氮空位中心的量子传感实验。该代理自主选择单个NV中心,校准共振频率,进行Ramsey测量得到T2*,并添加CPMG测量检查弱特征。工作流结合持久项目记录、定量计算与数据分析工具。同时引入了两个离线基准,用GPT-5.4、GPT-5.5和GPT-5.6 Sol评估代理的推理能力,发现更高推理努力可改善残差校准偏移识别,但pODMR基准中仅凭脉冲序列在高推理努力下产生更多假阳性,而要求预期信号计算可保持低假阳性率。

为什么值得看以往量子传感实验依赖人工操作,而该工作流让LLM代理自主完成从选择NV中心到复杂测量的完整流程,并能主动检查弱特征,显著减少人工干预。同时引入离线基准,为评估自主实验中的AI推理能力提供了可复现的方法,这是量子传感自动化领域的实质性进展。
arXiv AI1

PatientAgentBench:面向患者的健康AI代理评估基准框架

论文提出PatientAgentBench基准,用于评估面向患者的健康AI代理系统。该基准让基础模型封装为代理,使用沙盒工具与模拟患者对话,通过LLM-as-a-Jury在六个维度评分,并经过临床医生验证一致性(79%-93%)。在10个模型、1200个场景测试中发现临床差距:最弱模型分诊通过率仅32%,最强88%;代理常未经临床筛查处理行政请求;最弱模型编造未执行动作,前沿模型仍有1%-3%失败。最强模型总体得分4.25/5。

为什么值得看此前基准仅评估医学知识问答或面向临床医生的任务,而PatientAgentBench首次系统评估面向患者的代理系统在真实临床场景中的分诊、安全和工作流准确性,揭示了当前代理普遍存在的临床差距,为开发更安全的患者交互AI提供了可量化的评价维度。
arXiv AI1

Albilich:结合CAS的LLM数学研究可操控证明状态编排

Albilich 是一个开源 agentic 框架,用于数学自动研究,结合长程推理、计算机代数系统(CAS)、文献检索和 SQLite 上下文管理。在 RealMath 基准上,启用 CAS 解决 10/10 问题,无 CAS 解决 9/10;在 Kourovka Notebook 中,解决了 Problem 21.142 的反例和 Problem 20.2 的加强版证明。消融实验显示 CAS 可减少 32.0% 的 token 消耗。

为什么值得看此前 LLM 在数学研究中的长程证明尝试难以协调、评估和复现;Albilich 通过开源 harness 集成 CAS 和可操控性,在标准化基准和未解决问题上取得高成功率,为 AI 辅助数学研究提供了可复现的框架。
arXiv AI1

一种经济高效的多模态LLM推理框架用于不规则临床时间序列问答

arXiv发表论文提出ClinPRISM,这是一个针对不规则临床时间序列问答的经济高效多模态LLM推理框架。它采用不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,使用4B参数LLM骨干,仅用16个时间序列令牌,推理延迟0.15秒/问题,在基准测试上达到当前最优性能。

为什么值得看此前多模态时间序列LLM难以处理临床数据的稀疏性、异步性和不规则采样模式。ClinPRISM通过专用架构解决了这一关键局限,并以极低的计算成本(仅16个令牌)实现了快速推理(0.15秒),使临床问答更实用。
arXiv AI1

用于让冻结LLM代理学习领域的控制系统、数据集与配方

论文提出一种控制系统,将LLM代理的harness(提示模板、工具集、记忆层等)视为小型固定动作空间,使用ε-greedy上下文赌博机和REINFORCE强化学习在线优化策略,避免昂贵的代码搜索或不可审计的自我修改代码。在工具使用工作流、代码生成(HumanEval)和多跳检索QA(HotpotQA)任务上验证,支持Ollama和AWS Bedrock两种模型提供商,并开源了代码、数据集和部署配方。

为什么值得看此前Meta-Harness和HyperAgents优化harness的方式要么依赖昂贵代码搜索循环,要么产生不可审计的自我修改代码;本文提供一种更受约束、可审计且样本高效的方法,可在不访问模型内部的情况下通过黑盒API优化代理行为。
arXiv AI1

EMBL AI Librarian:面向AI代理的生命科学知识层

EMBL推出AI Librarian,这是一个面向AI代理的生命科学知识层,升级欧洲PMC接口。它让代理能用自然语言提问并获得直接答案,通过单个LLM规划子查询、阅读论文并定位证据。在ScholarQABench上,其引用F1指标提升超过16点;在LitQA2基准上,GPT-5.4代理使用Librarian后得分高出约8点。

为什么值得看此前,Europe PMC等资源仅支持关键词和复杂语法,返回整篇论文,AI代理需自行学习语法、多次搜索并阅读全文。EMBL AI Librarian让代理用自然语言提问即可获得证据,显著降低使用门槛,提升检索效率和准确性,在多个基准上表现优于强基线。