AI 日报
2026年7月20日星期一
- 本期重点
- 10
- 预计阅读
- 7 分钟
PERIOD HIGHLIGHTS
本期看点
INDUSTRY
行业动态
企业 AI 编排:部署问题而非平台问题,多数“Agent”实为聊天机器人
基于 101 家企业调研,Agent 编排正向模型提供商平台(Anthropic Claude 领先)集中选择,但实际部署的“Agent”中仅少数是真正多步骤编排工作流,多数仍是聊天机器人包装器,且实时成本控制例外。
2026年7月20日星期一
PERIOD HIGHLIGHTS
INDUSTRY
基于 101 家企业调研,Agent 编排正向模型提供商平台(Anthropic Claude 领先)集中选择,但实际部署的“Agent”中仅少数是真正多步骤编排工作流,多数仍是聊天机器人包装器,且实时成本控制例外。
在2026年上海世界人工智能大会上,中国国家主席习近平宣布为全球南方国家提供5000个人工智能培训名额,并启动“世界人工智能合作组织”。计划后续与东盟、非盟、金砖国家等建立合作中心。此举被视为中国系统性地构建平行于西方影响的AI治理结构的明确举措。
Anthropic 宣布从7月20日起,在Max和Team Premium订阅计划中提供Claude Fable 5,但使用限额仅为常规限额的50%,且常规限额当天减少三分之一。同时,Pro用户将获得一次性100美元信用额度,之后按API费率计费。这一变化逆转了原先从订阅中完全移除Fable的计划,可能是为了应对OpenAI更便宜的GPT-5.6 Sol带来的竞争压力。
VentureBeat Pulse Research 对 157 家企业的调查发现,企业正赋予 AI 智能体更多自主权,但对评估测试的信任度下降。50% 的组织曾部署通过内部评估但在生产中对客户失败的智能体,仅 5% 完全信任自动化评估,主要弱点是评估与现实结果不一致。三分之二已允许或正推进仅依靠自动化评估就部署智能体变更,无人工参与。
Google 在 2026 年 I/O 大会上宣布对其搜索框进行 25 年来最大幅度的重新设计,将其从简单的关键词输入框转变为支持文本、图像、PDF、视频及 Chrome 标签页等多种输入形式的 AI 驱动对话启动器。同时,公司合并了 AI Overviews 和 AI Mode 功能,消除用户在不同搜索体验间的切换摩擦。Google 搜索与 AI 副总裁 Liz Reid 称这是“自 25 年前推出以来最大的升级”。
RESEARCH
一项研究分析了207个GitHub项目中的102万次PR审查,跨越人类中心、LLM辅助和AI代理三种代码审查时代。研究发现,AI代理参与的协作模式(特别是AI代理发起或涉及多个AI代理的审查)在渐进式AI采用和快速AI代理采用策略下,能加快审查决策速度,但这些效率提升并未转化为更好的审查质量。人类与AI的协作模式成为审查效率的最强解释因素。
开源项目RAGU发布了一个模块化多步GraphRAG引擎,通过两阶段类型提取、DBSCAN去重、LLM摘要和Leiden社区检测分离知识图谱构建中的提取与整合。同时训练了7B参数专用模型Meno-Lite-0.1,聚焦语言理解技能,在知识图谱构建上比Qwen2.5-32B提升12.5%,在医学基准上召回率达0.84以上,超HippoRAG2。项目可pip安装,单GPU运行,MIT协议开源。
Cura 1T 是一个医疗保健专用的大语言模型,通过人工门控的自我进化循环训练,同时覆盖患者咨询、临床推理、交互诊断和电子健康记录工具使用等场景。在医疗评估套件中排名前沿,且在领域外推理和代理基准上保持竞争力。
阿里发布RecGPT-V3,一种状态化混合模态推荐系统,部署在淘宝“猜你喜欢”Feed。它通过记忆中心维护用户结构化记忆,将用户建模计算降低55.8%;混合模态基座模型联合推理文本标签和语义ID,突破信息瓶颈;潜在意图推理将推理路径压缩为可解码的潜令牌,输出token成本降低200倍。
通过国际象棋控制实验,研究人员发现大语言模型的强化学习后训练性能可由预训练损失准确预测,且RL奖励曲线斜率随预训练token数线性改善。RL并非简单锐化监督微调策略,而是在简单题上放大SFT已偏好的正确动作,在难题上浮现SFT中几乎不存在的正确动作。研究还将这些发现迁移至数学领域文本。