AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期日报

8月16日星期日78月15日星期六148月14日星期五168月13日星期四148月12日星期三158月11日星期二108月10日星期一78月9日星期日98月8日星期六118月7日星期五98月6日星期四118月5日星期三128月4日星期二178月3日星期一108月2日星期日98月1日星期六97月31日星期五37月30日星期四117月29日星期三147月28日星期二177月27日星期一157月26日星期日87月25日星期六77月24日星期五107月23日星期四107月22日星期三117月21日星期二137月20日星期一107月19日星期日17月18日星期六57月17日星期五127月16日星期四10
返回情报流
AILORE SIFTDAILY · 2026.07.28

AI 日报

2026年7月28日星期二

本期重点
17
预计阅读
9 分钟
01模型进展302产品与商业403行业动态504论文研究5
00

PERIOD HIGHLIGHTS

本期看点

  1. 01Kimi-K3:开放权重多模态智能体模型模型
  2. 02Kimi K3 开源:2.8T MoE 模型与技术报告模型
  3. 03Kimi K3 上线 Modal,支持无损加速推理模型
  4. 04Rivault:用Face ID批准AI代理的数据访问产品
  5. 05Kimi发布从42个基准失败模式归纳的视觉感知基准PerceptionBench产品
01

MODEL RADAR

模型进展

3 条
Hugging Face Model Radar1

Kimi-K3:开放权重多模态智能体模型

基于Hugging Face Trending上发布的Kimi K3模型介绍,该模型是一个开放权重的原生多模态智能体模型,参数量2.8T,采用Kimi Delta Attention和Attention Residuals架构,支持100万token上下文窗口,是世界首个开放的3T级模型,具备长时编码、智能知识工作等能力。

为什么值得看这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。
AIHOT · X / 公众号精选1

Kimi K3 开源:2.8T MoE 模型与技术报告

Kimi 发布其最强模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,具备原生视觉理解和 1M token 上下文窗口。新架构实现了每单位计算 2.5 倍的智能提升。除模型权重外,Kimi 还开源了高性能注意力内核、MoE 通信库及大规模智能体运行环境基础设施。

为什么值得看Kimi K3 是首个 2.8T 参数的开源 MoE 模型,并具备原生视觉理解与 1M token 超长上下文。每单位计算智能提升 2.5 倍,意味着更强的性能与更低的推理成本,且开源了配套基础设施,降低了多模态、长上下文应用的开发门槛。
AIHOT · X / 公众号精选1

Kimi K3 上线 Modal,支持无损加速推理

Kimi K3 模型上线 Modal 平台,并与 Modal 成为 Day 0 发布合作伙伴。双方为 K3 架构训练了自定义 DFlash 投机器,实现更快推理且无质量损失。

为什么值得看此前推理速度提升常伴随质量下降,K3 通过自定义 DFlash 投机器同时实现加速和质量无损,标志着推理效率的重要进步。
02

PRODUCT

产品与商业

4 条
Product Hunt1

Rivault:用Face ID批准AI代理的数据访问

Rivault是一款新产品,允许用户通过Face ID授权AI代理访问数据。该工具将生物识别认证集成到AI代理的数据访问流程中,确保只有经过用户面部识别确认后才能授予权限。

为什么值得看此前AI代理的数据访问往往缺乏用户层级的明确授权或仅依赖简单确认,Rivault引入Face ID生物识别,显著提升了授权过程的安全性和用户控制力,减少了未经授权访问的风险。
AIHOT · X / 公众号精选1

Kimi发布从42个基准失败模式归纳的视觉感知基准PerceptionBench

Kimi.ai 发布视觉感知基准 PerceptionBench,该基准通过分析前沿模型在 42 个现有基准上的失败模式,将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题。每道题只考察单一感知能力,无需推理或外部知识,旨在更精准地评估模型视觉感知的薄弱环节。

为什么值得看相比传统视觉基准,PerceptionBench 首次基于前沿模型的实际失败模式进行归纳,并拆解为单一原子能力,能更清晰地定位模型在特定感知能力上的缺陷,而非混合推理或知识后的整体表现。
Product Hunt0

Grok 4.5模型发布

SpaceXAI在Product Hunt上发布了名为Grok 4.5的模型,该模型主要面向编码、代理任务和知识工作场景。

Product Hunt0

Tunio:面向场所的AI音乐运营平台

Tunio是一个面向场所的AI音乐运营平台,其信息于2026年7月26日出现在Product Hunt上,但缺乏具体功能和使用场景的详细描述。

03

INDUSTRY

行业动态

5 条
Anthropic News1

Cognizant与Anthropic扩大合作,将Claude带给企业客户

2026年7月27日,Anthropic宣布与Cognizant扩大合作伙伴关系,旨在将Claude模型引入企业客户。合作的重点是让企业更容易采用Claude。

为什么值得看Cognizant作为大型IT服务商,其与Anthropic的深化合作意味着Claude在企业级市场的推广渠道进一步拓宽,可能加速企业AI应用落地。此前合作仅停留在试点或有限范围,此次扩展标志着更广泛的商业化部署。
The Decoder AI News1

微软发布自研网络安全模型MAI-Cyber-1-Flash,最严峻任务仍依赖OpenAI

微软发布了自研的紧凑型网络安全模型MAI-Cyber-1-Flash,嵌入MDASH多智能体系统后,在CyberGym基准测试中得分96%。相比纯前沿模型,成本预计降低50%,因为仅将复杂任务转发给OpenAI的GPT-5.4处理。微软在复杂推理任务上仍依赖OpenAI。

为什么值得看此前微软在网络安全领域高度依赖OpenAI的模型,现在通过自研紧凑模型可处理大部分场景,成本显著下降,但复杂推理仍依赖外部,表明微软在关键任务上尚未完全自立。
The Decoder AI News1

Moonshot AI 发布 Kimi K3 开放权重与基础设施

中国AI公司Moonshot AI发布了Kimi K3的模型权重并开源了部分基础设施。该模型在常见基准测试中接近西方前沿模型如Fable 5和GPT-5.6 Sol,但独立测试发现其在网络安全和数学性能上存在明显差距,可能源于蒸馏。

为什么值得看Kimi K3是少数接近前沿水平的中国开源模型之一,其开放权重可能降低开发者获取高质量模型的成本,但独立测试揭示的性能差距提示用户需谨慎评估。
TechCrunch AI1

微软发布首个网络安全模型及新型智能安全系统

微软本周推出其首个AI安全模型及一个全新AI安全平台,旨在增强网络安全产品组合。

为什么值得看这是微软首次推出专用于网络安全的人工智能模型,标志着其从通用AI转向垂直行业安全模型,可能改变安全产品研发路径。
OpenAI News1

AI 如何扩展人们在工作中所做的事情

OpenAI 发布新研究,显示 AI 正在扩大工人的工作范围。使用 ChatGPT 的用户会跨越原本的角色边界承担更多任务,从而重塑工作职能界限。

为什么值得看此前常见观点是 AI 会替代岗位,但 OpenAI 的研究表明工人借助 ChatGPT 能够承担跨角色任务,可能改变人们对工作职责的默认理解。
04

RESEARCH

论文研究

5 条
arXiv AI1

前沿大模型规则评估中“异常链崩溃”故障的发现与神经符号解决方案

arXiv 论文报告前沿大语言模型在嵌套条件规则评估中存在“异常链崩溃”故障,且模型准确性会无通知地漂移(如 GPT-5.4 从 96.6% 升至 100%)。作者提出 Aethis Eligibility Module,一种神经符号架构,让 LLM 从权威源编写规则,再由 SMT 层确定性执行。在 225 个场景基准、20 个对抗用例和 9 个 LegalBench 任务(949 例)中,该引擎准确率显著优于三个前沿模型(McNemar p≤0.003)。

为什么值得看此前认为前沿 LLM 在规则理解上足够可靠,该发现表明模型在复杂嵌套规则下存在系统性失败,且准确性会无版本变更地自行变化,这对监管合规领域(如保险、法律)构成不可预见的合规边界漂移风险,质疑了直接使用 LLM 进行关键规则判断的可靠性。
arXiv AI1

多模态自动事实核查动态评估的污染问题新发现

研究者针对多模态自动化事实核查(MAFC)的评估污染问题,构建了动态基准ClaimReview2025Q4并进行实验。发现动态评估虽减少污染但未完全消除,17.09%–29.30%的截止日期后声明仍可被LLM内部知识验证;污染可导致Macro-F1虚高11.34分并扭曲系统排名。研究提供了可信评估的实践指南。

为什么值得看此前认为收集LLM知识截止日期后的声明即可实现无污染评估,但研究表明即使声明发布时间晚于截止日期,仍有两到三成可通过公开知识直接或综合验证,这意味着动态评估的“无污染”假设不成立,行业对事实核查模型真实能力的判断可能被高估。
arXiv AI1

智能代理软件开发中第三方API路由器的代价何在?

一项针对代码代理工作流的实证研究发现,第三方API路由器位于代理与LLM提供商之间,虽作为统一访问层,却因缺乏输出与实际执行动作的一致性验证,使客户端权限机制形同虚设。论文设计了四种注入级别(L1-L4)并开发了SIDEL框架评估,结果显示在未额外防御时所有测试代理的防御成功率为0%。

为什么值得看此前普遍认为第三方API路由器仅简化接口调用,但该研究证实其作为可信中间层可任意修改请求/响应,且现有客户端防护(白名单、LLM审查)完全无法检测此类注入,意味着依赖第三方路由器的代码代理面临严重安全漏洞。
Hugging Face Daily Papers1

多头隐式控制:为LLM智能体决策提供统一接口

研究提出Multi-Head Latent Control,一种轻量层,通过读取冻结LLM或VLM的隐状态轨迹,生成部署时的控制信号。它包括Capability Head(预测模型能力)和Resolution Head(决定澄清、工具调用、拒绝或直接回答),仅在冻结模型隐轨迹上训练,无需修改模型。在语言和视觉语言任务中,多模型系统质量-成本权衡改善,路由执行中大模型使用减少最高90.7%。

为什么值得看此前基于提示路由、外部编排或任务微调的方式依赖输入侧信号,成本高且难以维护。本方法直接从模型隐生成过程推断控制决策,实现后验适配,无需改动骨干模型,大幅降低大模型调用成本。
arXiv AI1

离线-在线课程强化学习用于多模态推理

O^2-CritiCuRL提出离线-在线课程强化学习框架,解决多模态大模型推理中依赖虚假捷径、中间步骤不可靠的问题。离线阶段通过多rollout分析估计步骤重要性,蒸馏关键推理步骤;在线阶段采用渐进式步骤级强化学习,用截断链引导模型补全缺失步骤。在多模态推理基准上取得最优性能,同时训练和推理效率更高。

为什么值得看此前多模态大模型在推理中常产生有缺陷的中间步骤却得到正确最终答案,说明依赖捷径而非忠实推理。O^2-CritiCuRL首次通过离线-在线范式引入步骤级关键意识,克服静态监督局限,使模型聚焦于关键推理步骤,显著提升可解释性和可靠性,并实现更好的训练与推理效率。
前一期返回情报流后一期