AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
AILORE SIFT情报简报
日报周报月报

往期日报

8月16日星期日78月15日星期六148月14日星期五168月13日星期四148月12日星期三158月11日星期二108月10日星期一78月9日星期日98月8日星期六118月7日星期五98月6日星期四118月5日星期三128月4日星期二178月3日星期一108月2日星期日98月1日星期六97月31日星期五37月30日星期四117月29日星期三147月28日星期二177月27日星期一157月26日星期日87月25日星期六77月24日星期五107月23日星期四107月22日星期三117月21日星期二137月20日星期一107月19日星期日17月18日星期六57月17日星期五127月16日星期四10
返回情报流
AILORE SIFTDAILY · 2026.07.24

AI 日报

2026年7月24日星期五

本期重点
10
预计阅读
7 分钟
01模型进展302行业动态203论文研究5
00

PERIOD HIGHLIGHTS

本期看点

  1. 01Solar-Open2-250B模型:250B参数激活15B的百万token上下文开源大模型模型
  2. 02Nanbeige4.2-3B模型
  3. 03Laguna-S-2.1:面向智能体编程的118B MoE模型模型
  4. 04篡改的ChatGPT链接可每五分钟生成一个受攻击者操控的恶意AI代理新闻
  5. 05OpenAI 向所有美国用户开放 ChatGPT Health新闻
01

MODEL RADAR

模型进展

3 条
Hugging Face Model Radar1

Solar-Open2-250B模型:250B参数激活15B的百万token上下文开源大模型

韩国公司Upstage发布开源大模型Solar-Open2-250B,参数规模2500亿但每个token仅激活150亿参数。模型采用混合注意力机制的MoE架构,融合线性注意力和softmax注意力,支持百万token上下文窗口。训练时从上一代模型Solar Open 1继承部分权重,降低了从头训练成本。模型专为代理工作流设计,包括工具调用、多步推理等任务。

为什么值得看此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。
Hugging Face Model Radar1

Nanbeige4.2-3B

Nanbeige4.2-3B是一个仅3B参数的精简代理模型,采用循环Transformer架构复用层以增加容量而不增加参数。在SFT中通过真实与合成环境扩展训练多样性,RL阶段结合结果与过程奖励。在工具使用、办公代理和代码代理基准上优于Qwen3.5-9B和Gemma4-12B等更大模型,推理能力在同规模开源模型中领先,并可集成到个人工作流代理框架如OpenClaw中。

为什么值得看该模型以不到其他模型三分之一参数实现超越,证明循环架构能有效提升小模型代理能力。此前小模型在复杂代理任务上表现较弱,Nanbeige4.2-3B填补了这一空白,为资源受限场景提供可行方案。
Hugging Face Model Radar1

Laguna-S-2.1:面向智能体编程的118B MoE模型

Hugging Face 上发布了一个名为 Laguna-S-2.1 的混合专家模型,总参数118B,每令牌激活8B参数。该模型专为智能体编程和长时间任务设计,支持1M上下文窗口、原生推理思考,并具有推测解码和多种量化变体。许可证为 OpenMDW-1.1,允许免费商用。

为什么值得看与之前的 Laguna XS 2.1(33B-A3B)相比,Laguna-S-2.1 在激活参数相近的情况下提供了更大的总容量(118B),同时保持 1M 超长上下文和推理思考能力,且采用宽松许可证,降低了企业部署和定制门槛。
02

INDUSTRY

行业动态

2 条
The Decoder AI News1

篡改的ChatGPT链接可每五分钟生成一个受攻击者操控的恶意AI代理

网络安全公司Zenity Labs发现OpenAI Agent Builder中存在一个名为AgentForger的漏洞。攻击者只需一个被篡改的ChatGPT链接,即可在目标员工不知情的情况下创建一个自主代理。该代理继承了受害者的身份和访问权限,通过预设恶意提示绕过审批流程,并能每五分钟从攻击者的收件箱拉取新指令执行。

为什么值得看该漏洞表明AI agent的安全机制存在根本缺陷,攻击者不仅能创建无审批的自主代理,还能持续远程控制,使传统的单次钓鱼攻击升级为持久性威胁,对使用AI代理的企业内部权限和自动化流程构成严重风险。
TechCrunch AI1

OpenAI 向所有美国用户开放 ChatGPT Health

OpenAI 宣布向所有美国用户开放 ChatGPT Health 功能,用户可将 Apple Health、Function 和 MyFitnessPal 等服务的个人数据集成到该应用中。

为什么值得看此前 ChatGPT Health 可能仅限部分用户测试或内测,此次全面开放意味着美国用户均可使用,且支持集成多个主流健康数据源,使健康管理更便捷。
03

RESEARCH

论文研究

5 条
arXiv AI1

基于图的Agentic AI与LangGraph:面向长期运行有状态业务流程的工作流路径

一篇实践指南论文将LangGraph定位为面向长期运行、有状态、多步骤生成式AI业务流程的低层级编排框架,通过三个可执行配方(SQL分析带修复循环、证据门控的agentic RAG、带中断检查点的人机协作审核)展示类型化状态、条件路由、确定性工具等机制如何协同工作,并指出在简单工具调用、结构化提取或提示优化场景下应优先选择ReAct、schema-first工具或DSPy。

为什么值得看此前LangGraph常被视为模型质量基准,这篇指南将其明确为工作流复杂度的匹配工具,而非通用默认方案,帮助产品与技术团队根据流程复杂度(如是否需要中断恢复、审计追踪)选择正确的编排层次,避免对简单任务过度设计。
arXiv AI1

Euclid-MCP:通过 Prolog 实现确定性逻辑推理的模型上下文协议服务器

Euclid-MCP 是一个开源的 MCP 服务器,通过 SWI-Prolog 为 LLM 提供确定性逻辑推理能力。它引入 Euclid-IR 中间表示,支持 translate-run-inspect-repair 循环,使 LLM 可委托推理并获取证明轨迹。在 IT 安全合规测试中,Euclid-MCP 在大规模知识库上比纯 LLM 更准确、延迟更低、输出更紧凑。

为什么值得看此前 LLM 在多步逻辑推理中常产生幻觉,缺乏可靠规则执行能力。Euclid-MCP 提供标准化接口,将确定性符号推理与 LLM 的自然语言能力结合,填补了安全关键领域缺乏可靠推理基座的空白。
arXiv AI1

开放域问答中推理的无参考评估

该研究提出一种无需参考答案的推理审计框架,通过将LLM生成的推理轨迹分解为片段,利用自然语言推理(NLI)标记片段间的局部前提-目标关系并构建超图,再执行确定性反向AND-OR搜索来分配片段级审计标签。在数学推理基准Hard2Verify和医学推理基准UroReason上测试,该框架比直接使用LLM作为评判更可靠,能识别出流畅但推理薄弱的回答。UroReason数据集将通过API开放,代码也将开源。

为什么值得看此前评估开放域问答通常依赖参考答案或LLM直接评判,后者易被流畅但推理薄弱的回答欺骗。本方法不依赖参考答案,通过细粒度分解推理轨迹实现更可靠的自动审计,尤其适用于医疗等高风险领域,为LLM输出的可信度验证提供了新路径。
arXiv AI1

无云端的编码代理:评估开源权重大语言模型在纵向数据准备任务中的表现

一篇arXiv论文开发了一个开源框架,用于评估开源权重大语言模型在纵向数据准备任务上的效能。框架包含真实数据集、任务定义和自动评估脚本。基准测试显示,31-35B参数的开源模型在消费者级硬件上平均任务完成率达87.9%,表明本地部署AI辅助数据准备在治理受限的研究场景中可行。

为什么值得看此前敏感数据的数据准备通常需要发送到第三方云端模型,受限于治理要求无法广泛采用。该研究表明,开源权重模型在消费者级硬件上即可达到接近饱和的任务完成率,为治理受限的研究机构提供了不传输数据的AI辅助路径。
arXiv AI1

IssueTrojanBench:针对恶意 issue 请求的 AI 编码代理基准测试

IssueTrojanBench 基准测试评估了基于 LLM 的 AI 编码代理(Cursor、Claude Code、Codex Desktop)面对恶意 issue 请求的安全性。结果显示 66.5% 的恶意 issue 穿透了所有代理和 LLM 级别防护,拒绝行为几乎完全来自 LLM 而非代理框架,GPT 模型广泛存在漏洞,而 Sonnet 4.6 展现更选择性的风险阻断。

为什么值得看此前缺乏系统性评估编码代理面对恶意请求的脆弱性,该研究首次揭示当前部署的代理普遍存在严重安全漏洞,且现有代理级防御策略效果有限,主要依赖 LLM 自身判断。
前一期返回情报流后一期