arXiv AI1
arXiv 发布论文,提出多智能体对抗评估平台,用于压力测试角色扮演语言智能体(RPLAs)。系统含审讯代理、目标代理和评判代理,通过六种渐进对抗策略进行多轮对话测试。实验覆盖三种角色和三家前沿LLM,发现多策略对抗评估能揭示单策略遗漏的失败模式,平均降低鲁棒性评分0.17-0.20,并验证了跨模型一致性退化。
为什么值得看现有评估多依赖静态基准或单轮问题,难以捕捉长对话中的累积行为失败。本研究提出多智能体、多策略对抗框架,能暴露更隐蔽的失败模式,且自动评判与人类评分高度相关,为高安全要求场景下的RPLA提供系统化评估新工具。
arXiv AI1
一项实证研究调查了开源软件系统中LLM服务框架和方法的使用情况,分析了vLLM、SGLang、TensorRT-LLM、LMDeploy和FlashInfer五个框架。结果显示vLLM在流行度和采用率上最突出,并行计算、内存管理和网络剪枝是最常用的服务方法类别,多框架使用有限但能互补。
为什么值得看此前关于LLM服务的研究多聚焦于技术提案,缺乏对其实际采用情况的了解。该研究揭示了真实项目中框架和方法的使用模式,有助于产品经理和技术决策者理解市场现状,指导技术选型和架构设计。
arXiv AI1
一篇论文评估了六个LLM在企业平台中生成工作流的性能,基于29个真实IT自动化场景、两个生成架构和2784次运行。初始单体架构的结构成功率仅31.5%-82.8%,而重构的分片流水线将成功率提升至74.1%-97.8%。较小的模型mistral-small达到95.7%成功率,成本为每个工作流0.01美元,而成本更高的模型表现更好但也更贵,如gpt-oss-120b达到97.8%,但成本高19倍。
为什么值得看该研究证实,通过分片分解,小型模型可在成本和成功率上达到生产可用,降低对昂贵前沿模型的依赖,为企业自动化提供了更经济的选择,可能改变LLM选型决策。
arXiv AI1
LACE 是一个由 LLM 辅助的多智能体框架,用于 RISC-V 指令集扩展的敏捷开发。它将自然语言指令意图转换为两级中间表示,执行检索引导的局部 RTL 编辑,并使用 riscv-formal 检查流程闭环验证。在四个嵌入式 RISC-V 核心上,pass@1 生成准确率从接近零提升至 72.8%,代码已开源。
为什么值得看此前 RISC-V 指令集扩展(ISAX)的实现和验证在不同内核间进展缓慢且碎片化,需要针对每个内核进行接口适配,差分测试在微架构或 ISAX 变化时经常失效。LACE 通过多智能体工作流和两级 IR,显著提高了生成准确率(从近零到 72.8%),减少了集成返工,为指令扩展的自动化提供了新路径。
arXiv AI1
研究人员提出SCOPE,一个基于19个领域300篇顶级论文的科学实验设计评估基准,测试LLM在高层次规划完整性和低层次配置准确性上的表现。结果显示多数LLM无法直接设计高质量实验,且存在低层配置瓶颈,搜索模式无改善。为此提出OptED智能体工作流,通过阶段隔离、工具增强和规则约束优化实验设计。
为什么值得看此前AI for Research研究多聚焦代码实现,忽视实验设计阶段,且缺乏系统评估基准。SCOPE填补这一空白,首次量化LLM在实验设计上的能力边界,揭示现有模型局限,推动AI自动化科学研究向完整工作流发展,为相关产品提供评估标准和改进方向。