论文AiFlow:面向流式 LLM 应用的 Token 原生反应式编排与有界背压
此前流式 LLM 工作流常将生成视为粗粒度的请求-响应步骤,队列、并发和背压依赖临时回调代码。AiFlow 首次将 Token 级增量标准化为类型化事件,并用 Node Guardian 声明式管理有界队列,使背压、顺序和重试成为可静态验证的系统属性,减小了应用端延迟。
TOPIC · CURATED VIEW
模型从回答问题走向规划、调用工具和完成多步任务。这里追踪 Agent 框架、产品与可靠性评测。
此前流式 LLM 工作流常将生成视为粗粒度的请求-响应步骤,队列、并发和背压依赖临时回调代码。AiFlow 首次将 Token 级增量标准化为类型化事件,并用 Node Guardian 声明式管理有界队列,使背压、顺序和重试成为可静态验证的系统属性,减小了应用端延迟。
现有评估多依赖静态基准或单轮问题,难以捕捉长对话中的累积行为失败。本研究提出多智能体、多策略对抗框架,能暴露更隐蔽的失败模式,且自动评判与人类评分高度相关,为高安全要求场景下的RPLA提供系统化评估新工具。
以往量子传感实验依赖人工操作,而该工作流让LLM代理自主完成从选择NV中心到复杂测量的完整流程,并能主动检查弱特征,显著减少人工干预。同时引入离线基准,为评估自主实验中的AI推理能力提供了可复现的方法,这是量子传感自动化领域的实质性进展。
医院AI部署多为部门级孤岛,70-80%试点难以规模化。该研究提出将合规与策略集中化的多层架构,为医院AI从单点工具走向平台化、合规化提供了可落地的蓝图,可能改变医院AI的采购和实施模式。
此前基准仅评估医学知识问答或面向临床医生的任务,而PatientAgentBench首次系统评估面向患者的代理系统在真实临床场景中的分诊、安全和工作流准确性,揭示了当前代理普遍存在的临床差距,为开发更安全的患者交互AI提供了可量化的评价维度。
此前LangGraph常被视为模型质量基准,这篇指南将其明确为工作流复杂度的匹配工具,而非通用默认方案,帮助产品与技术团队根据流程复杂度(如是否需要中断恢复、审计追踪)选择正确的编排层次,避免对简单任务过度设计。
相比依赖云端的健康助手,ECHO 可在消费硬件本地运行,数据不外传,符合 GDPR 和 KVKK,可能降低隐私合规成本。其安全层超越零样本 LLM,如 Llama 3.3 70B,表明小型模型结合专用模块可达到实用水平,对资源受限场景有意义。
此前智能体通常依赖模型微调或上下文窗口处理长期任务,而 Argus 展示了通过持久化运行时状态和控制策略实现自我进化,无需更新模型权重。其通过验证门控的自我进化机制,显著提升任务准确率并降低后续任务的消耗,为智能体在真实复杂任务中的应用提供了新范式。
此前 LLM 在数学研究中的长程证明尝试难以协调、评估和复现;Albilich 通过开源 harness 集成 CAS 和可操控性,在标准化基准和未解决问题上取得高成功率,为 AI 辅助数学研究提供了可复现的框架。
现有智能体系统在跨设备场景中缺乏有效状态管理,多智能体系统也未维护跨设备、跨时间的紧凑携带状态。该论文提出以状态设计为核心的原则,并通过基准测试证明其优势在多种 MLLM 设置下稳健,为跨设备智能体的设计提供了新方向。
此前LLM代理无法识别任务实际所需的努力,往往无差别地读入所有上下文,造成大量浪费。E3首次引入了任务感知的执行范围估计,用最小资源完成正确操作,在成功率不变的前提下大幅降低了计算成本,为AI代理的实用化提供了重要的效率优化方向。
此前,Europe PMC等资源仅支持关键词和复杂语法,返回整篇论文,AI代理需自行学习语法、多次搜索并阅读全文。EMBL AI Librarian让代理用自然语言提问即可获得证据,显著降低使用门槛,提升检索效率和准确性,在多个基准上表现优于强基线。
此前对 AI 基础设施的优化多聚焦于大模型推理本身,而代理式工作流在数据中心中的独特资源需求未被系统研究。该研究首次通过生产环境数据揭示了 CPU 关键路径和碎片化执行等特征,为数据中心设计和服务器优化提供了新视角,可能推动基础设施投资方向的调整。
传统记忆系统仅保存交互内容,不建模信任。Σ-Mem首次引入在线可靠性记忆,使系统能基于历史反馈动态评估代理可信度,实现无需重训练的稳定适应,为多代理协调提供新机制。
此前 ISAC 相关研究(如基于学习的感知、资源分配、RIS、边缘智能、多智能体协调和弹性网络)大多孤立发展,缺乏统一视角。该综述首次将智能体 AI 与 ISAC 系统性地结合,提出闭环框架和成熟度分级,为这一领域提供了统一的研究坐标系,有助于后续研究聚焦、比较和推进。
此前 LLM 在多步逻辑推理中常产生幻觉,缺乏可靠规则执行能力。Euclid-MCP 提供标准化接口,将确定性符号推理与 LLM 的自然语言能力结合,填补了安全关键领域缺乏可靠推理基座的空白。
此前Meta-Harness和HyperAgents优化harness的方式要么依赖昂贵代码搜索循环,要么产生不可审计的自我修改代码;本文提供一种更受约束、可审计且样本高效的方法,可在不访问模型内部的情况下通过黑盒API优化代理行为。
此前评估仅关注单个模型在孤立EDA任务上的表现,缺乏对完整流程和agent系统的对比。该研究首次在统一环境下系统评估端到端EDA流程,揭示了agent架构和成本效率的巨大差异,对AI辅助芯片设计工具的选择和优化具有直接指导意义。
此前 LLM Agent 在工业控制中的可靠性存疑,缺乏安全硬约束。本研究证明,即使 LLM 能高频写设定值,仍需规则门控兜底,否则在扰动抑制等场景会出现严重退化,为工业场景引入 LLM 提供了可审计的安全屏障方案。
此前 RISC-V 指令集扩展(ISAX)的实现和验证在不同内核间进展缓慢且碎片化,需要针对每个内核进行接口适配,差分测试在微架构或 ISAX 变化时经常失效。LACE 通过多智能体工作流和两级 IR,显著提高了生成准确率(从近零到 72.8%),减少了集成返工,为指令扩展的自动化提供了新路径。
此前AI治理工具碎片化,无法应对代理架构特有的对齐漂移、影子AI等威胁。Traccia首次将OpenTelemetry遥测、语义护栏和执行血统整合为统一哈希追溯层,自动输出符合EU AI Act的合规证据包,为自主AI系统的企业级管理提供了可审计的机器可读基础。
此前AI代理的私钥常以明文或环境变量形式存储,存在被窃取风险。该方案通过硬件隔离密钥,使任何软件进程都无法直接获取密钥,将攻击成功率从19.3%降至0%,为高价值自动化操作提供了新的安全基线。
此前AI for Research研究多聚焦代码实现,忽视实验设计阶段,且缺乏系统评估基准。SCOPE填补这一空白,首次量化LLM在实验设计上的能力边界,揭示现有模型局限,推动AI自动化科学研究向完整工作流发展,为相关产品提供评估标准和改进方向。
此前敏感数据的数据准备通常需要发送到第三方云端模型,受限于治理要求无法广泛采用。该研究表明,开源权重模型在消费者级硬件上即可达到接近饱和的任务完成率,为治理受限的研究机构提供了不传输数据的AI辅助路径。
此前多智能体系统的并行研究多聚焦单一层次,缺乏对副本并行和结构并行的统一组织与协调。TIPEX 首次提出可控执行框架,系统验证两种并行的互补效果及与任务复杂度的关系,为优化多智能体推理效率提供了可操作的参考,可能影响后续系统设计范式。
此前代理评估只能判断模型选错工具,却无法解释原因。该研究提供了多维诊断框架,将单一错误转化为能力画像,为模型能力分层与安全评估提供新方法论,并揭示能力层级与安全性脱节的现象。
现有 AI 和无线网络架构分别受限于物理世界建模和实时协调能力,而 HDT-Nets 提出将网络基础设施与数字孪生结合,使智能体能主动推理并共享时空上下文,为物理 AI 在机器人、车辆等场景下的实时协调提供了新框架。
相较于前代 K-EXAONE,K-EXAONE 2.0 通过架构升级将模型容量扩大三倍以上,支持更长上下文和更多语言,并在智能体编码、长上下文理解等实用场景中获得最大提升,且以 Apache 2.0 开源,为开源模型生态提供了新的基础模型选择,标志着 LG 向全球前沿模型迈进。
该论文为经济模拟提供了系统化路线图,将分散的研究整合为六级能力框架,明确高能力系统(自进化代理、内生制度)的稀缺性,可能引导该领域研究方向,并为AI agent的训练和评估提供更真实的沙盒环境。
该研究量化了 LLM 编码智能体在仓库探索阶段的低效问题(例如 30B OpenHands 代理平均每解决一个问题消耗 631K 代币),并通过引入专用检索智能体,在不牺牲解题率的情况下显著降低了轮次和代币消耗,为提升编码智能体效率提供了可复现的解决方案。