AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期日报

8月16日星期日78月15日星期六148月14日星期五168月13日星期四148月12日星期三158月11日星期二108月10日星期一78月9日星期日98月8日星期六118月7日星期五98月6日星期四118月5日星期三128月4日星期二178月3日星期一108月2日星期日98月1日星期六97月31日星期五37月30日星期四117月29日星期三147月28日星期二177月27日星期一157月26日星期日87月25日星期六77月24日星期五107月23日星期四107月22日星期三117月21日星期二137月20日星期一107月19日星期日17月18日星期六57月17日星期五127月16日星期四10
返回情报流
AILORE SIFTDAILY · 2026.08.01

AI 日报

2026年8月1日星期六

本期重点
9
预计阅读
6 分钟
01模型进展202行业动态203论文研究5
00

PERIOD HIGHLIGHTS

本期看点

  1. 01DeepSeek V4 Flash 0731 开源,跻身开源模型前三模型
  2. 02Inkling-Small 发布,276B 参数性能持平原版模型
  3. 03Univé借助ChatGPT Enterprise打造AI就绪劳动力新闻
  4. 04Thinking Machines 发布第二款模型 Inkling Small,侧重效率而非规模新闻
  5. 05LEDGERMIND:基于结构化证据账本的来源约束多模态智能体推理论文
01

MODEL RADAR

模型进展

2 条
AIHOT · X / 公众号精选1

DeepSeek V4 Flash 0731 开源,跻身开源模型前三

DeepSeek于2026年7月31日发布开源模型DeepSeek V4 Flash 0731,采用MIT许可,总参数284B(激活13B),FP4/FP8混合精度约167GB。该模型在Artificial Analysis智能指数上得分50,位列开源模型前三,并已上线官方API。

为什么值得看此前DeepSeek模型已在开源社区有影响力,此次新版本在智能指数得分50,进入开源模型前三,表明其在性能上达到开源第一梯队,可能影响用户对开源模型的选择,并对闭源模型形成竞争压力。
AIHOT · X / 公众号精选1

Inkling-Small 发布,276B 参数性能持平原版

Thinking Machines 于 2026 年 7 月 30 日发布 Inkling-Small,该模型总参数 276B,激活参数仅 12B,规模约为原版 Inkling 的四分之一,但性能与原版相当。官方宣布开放完整权重,并已支持在 Tinker 平台进行微调及通过 Tinker Playground 进行文本、图像和音频交互。

为什么值得看Inkling-Small 以四分之一的总参数规模实现与原版相当的性能,且仅需 12B 激活参数,意味着在保持性能的同时大幅降低了资源消耗。这标志着高效模型在保持能力上取得进展,可能推动大模型在更广泛场景的部署。
02

INDUSTRY

行业动态

2 条
OpenAI News1

Univé借助ChatGPT Enterprise打造AI就绪劳动力

荷兰保险公司Univé借助ChatGPT Enterprise构建AI人才队伍,通过将领导力、负责任治理与员工主导的创新相结合,在组织规模上推动工作方式转型。该案例表明企业正将AI能力建设作为组织发展的战略重点,而不仅仅是工具部署。

为什么值得看这标志着企业AI应用从单点工具转向全员能力建设。Univé将治理机制前置,并鼓励员工主导创新,说明成熟企业开始系统化地管理AI引入,而非放任自流。这对同行具有参照意义。
The Decoder AI News1

Thinking Machines 发布第二款模型 Inkling Small,侧重效率而非规模

Thinking Machines(由前 OpenAI CTO Mira Murati 创立)发布了其第二个模型 Inkling Small。该模型为开放权重推理模型,体积不足 Inkling 的三分之一,但在多个编码和推理基准测试中表现优于 Inkling。

为什么值得看此前 Thinking Machines 仅有尺寸较大的 Inkling 模型,本次发布表明其开始探索小而高效的路线,且小模型在基准上反超,可能改变用户对模型规模的预期,并影响开源模型市场的竞争格局。
03

RESEARCH

论文研究

5 条
arXiv AI1

LEDGERMIND:基于结构化证据账本的来源约束多模态智能体推理

LEDGERMIND是一个多模态智能体推理系统,将代理轨迹建模为受来源约束的状态机,通过结构化证据账本来约束推理和决策。它引入三层接地协议、自适应双路径调度器和事件触发验证修复引擎,针对无支撑推理、实体幻觉、过度推理和修复放大等问题。实验表明,该方法在多个基准上提升了答案准确性和轨迹级忠实度。

为什么值得看此前多模态智能体评估仅关注最终答案准确性,无法区分正确回答是源于证据、语言先验还是错误抵消。LEDGERMIND首次将来源约束引入智能体轨迹状态,确保推理过程可追溯,能识别并修复无支撑推理和实体幻觉,从而提升模型可信度与可靠性。
arXiv AI1

自知老化的机器:硬件感知的自主智能框架

arXiv AI 发布论文,提出 Aging-Aware Autonomous Intelligence (AAAI) 框架,将硬件健康状态直接纳入推理、规划与任务执行。框架包含硬件自感知、自适应推理和生存中心智能三大支柱,通过闭路认知架构整合预测、生命周期管理和硬件感知计算,旨在缓解自主系统因老化导致的性能下降与任务失败,适用于太空、海洋及植入医疗设备等场景。

为什么值得看已有自主系统假定硬件恒定,老化的硬件与软件预期不匹配可能导致整机故障。AAAI 首次将硬件健康统一纳入自主决策闭环,应用预测模型主动适应能力衰减,为长期或安全关键任务中的系统韧性提供新路径。
arXiv AI1

Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

FrontisAI 发布论文,介绍 AI4AI 模型 Frontis-MA1(35B),在开放的 OpenMLE 全栈系统上,通过执行反馈的 SFT 和 RL 训练,结合进化搜索,使 MLE-Bench Lite 的 Medal Average 从 39.39% 提升至 60.61%,在 OpenMLE-Evo-Max 下达到 71.21%,超过 GPT-5.5+Codex,接近 GPT-5.6 Sol 和 Kimi K3。模型和代码已开源。

为什么值得看该工作将递归自我改进从概念推进到可执行系统:开放全栈 OpenMLE 支持训练、验证和进化,且模型性能在标准基准上显著提升,并超越 GPT-5.5+Codex,接近更大规模模型。这为 AI 自我改进提供了可复现的工程路径,可能加速 AI 研发效率。
arXiv AI1

WIDE:通过token级动态宽度剪枝提升自适应LLM推理

WIDE是一种端到端可微分的token级动态宽度剪枝框架,针对LLM推理的prefill和decode场景设计。它允许每个token动态选择注意力头组和FFN通道组,实现细粒度计算分配。在50%稀疏度下,相比最先进的动态深度剪枝方法,WIDE实现了55.1%的性能提升。

为什么值得看现有静态结构化剪枝硬件友好但精度损失大,动态剪枝又局限于粗粒度结构。WIDE首次将动态剪枝扩展到神经元块级别,并通过剪枝-内核协同设计实现实际加速,为高效LLM推理提供了新路径。
arXiv AI1

ORCA-bench:语言模型 agent 对 oncall 的 readiness 评估基准

ORCA-bench 是一个新基准,将通用编程 agent 置于生产级 oncall 环境,使用 OpenTelemetry 微服务系统,提供六天指标、日志和追踪数据,并包含 1,079 个 RCA 任务。五个前沿 agent 在中等难度任务上最佳 RCA 准确率为 25.3%,在困难任务上为 10.0%,最弱模型在 40% 报告中幻觉出不合理解释。

为什么值得看此前基准多聚焦代码生成或漏洞修复,而 ORCA-bench 首次将 agent 置于真实 oncall 环境,暴露了前沿编码 agent 在根因分析上的显著差距(25.3%/10.0%),表明 AI 在运维场景中的实际可用性远低于预期,为评估和投资提供了新标尺。
前一期返回情报流后一期