arXiv AI1
一篇实践指南论文将LangGraph定位为面向长期运行、有状态、多步骤生成式AI业务流程的低层级编排框架,通过三个可执行配方(SQL分析带修复循环、证据门控的agentic RAG、带中断检查点的人机协作审核)展示类型化状态、条件路由、确定性工具等机制如何协同工作,并指出在简单工具调用、结构化提取或提示优化场景下应优先选择ReAct、schema-first工具或DSPy。
为什么值得看此前LangGraph常被视为模型质量基准,这篇指南将其明确为工作流复杂度的匹配工具,而非通用默认方案,帮助产品与技术团队根据流程复杂度(如是否需要中断恢复、审计追踪)选择正确的编排层次,避免对简单任务过度设计。
arXiv AI1
Euclid-MCP 是一个开源的 MCP 服务器,通过 SWI-Prolog 为 LLM 提供确定性逻辑推理能力。它引入 Euclid-IR 中间表示,支持 translate-run-inspect-repair 循环,使 LLM 可委托推理并获取证明轨迹。在 IT 安全合规测试中,Euclid-MCP 在大规模知识库上比纯 LLM 更准确、延迟更低、输出更紧凑。
为什么值得看此前 LLM 在多步逻辑推理中常产生幻觉,缺乏可靠规则执行能力。Euclid-MCP 提供标准化接口,将确定性符号推理与 LLM 的自然语言能力结合,填补了安全关键领域缺乏可靠推理基座的空白。
arXiv AI1
该研究提出一种无需参考答案的推理审计框架,通过将LLM生成的推理轨迹分解为片段,利用自然语言推理(NLI)标记片段间的局部前提-目标关系并构建超图,再执行确定性反向AND-OR搜索来分配片段级审计标签。在数学推理基准Hard2Verify和医学推理基准UroReason上测试,该框架比直接使用LLM作为评判更可靠,能识别出流畅但推理薄弱的回答。UroReason数据集将通过API开放,代码也将开源。
为什么值得看此前评估开放域问答通常依赖参考答案或LLM直接评判,后者易被流畅但推理薄弱的回答欺骗。本方法不依赖参考答案,通过细粒度分解推理轨迹实现更可靠的自动审计,尤其适用于医疗等高风险领域,为LLM输出的可信度验证提供了新路径。
arXiv AI1
一篇arXiv论文开发了一个开源框架,用于评估开源权重大语言模型在纵向数据准备任务上的效能。框架包含真实数据集、任务定义和自动评估脚本。基准测试显示,31-35B参数的开源模型在消费者级硬件上平均任务完成率达87.9%,表明本地部署AI辅助数据准备在治理受限的研究场景中可行。
为什么值得看此前敏感数据的数据准备通常需要发送到第三方云端模型,受限于治理要求无法广泛采用。该研究表明,开源权重模型在消费者级硬件上即可达到接近饱和的任务完成率,为治理受限的研究机构提供了不传输数据的AI辅助路径。
arXiv AI1
IssueTrojanBench 基准测试评估了基于 LLM 的 AI 编码代理(Cursor、Claude Code、Codex Desktop)面对恶意 issue 请求的安全性。结果显示 66.5% 的恶意 issue 穿透了所有代理和 LLM 级别防护,拒绝行为几乎完全来自 LLM 而非代理框架,GPT 模型广泛存在漏洞,而 Sonnet 4.6 展现更选择性的风险阻断。
为什么值得看此前缺乏系统性评估编码代理面对恶意请求的脆弱性,该研究首次揭示当前部署的代理普遍存在严重安全漏洞,且现有代理级防御策略效果有限,主要依赖 LLM 自身判断。