- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月4日 08:18
- 状态
- 单一信源
发生了什么
一篇论文评估了六个LLM在企业平台中生成工作流的性能,基于29个真实IT自动化场景、两个生成架构和2784次运行。初始单体架构的结构成功率仅31.5%-82.8%,而重构的分片流水线将成功率提升至74.1%-97.8%。较小的模型mistral-small达到95.7%成功率,成本为每个工作流0.01美元,而成本更高的模型表现更好但也更贵,如gpt-oss-120b达到97.8%,但成本高19倍。
为什么重要
该研究证实,通过分片分解,小型模型可在成本和成功率上达到生产可用,降低对昂贵前沿模型的依赖,为企业自动化提供了更经济的选择,可能改变LLM选型决策。
底层逻辑
分片流水线将工作流生成分解为变量搭建、基础块组装和嵌套块生成,简化了每个步骤的复杂度,使较小模型也能有效处理JSON生成,从而在结构成功率上接近大型模型,同时显著降低成本。
产品与商业机会
企业可采用分片流水线架构,选择如mistral-small等低价模型,每个工作流成本降至0.01美元,同时保持高成功率,大幅降低自动化成本,缩短延迟至50秒内,支持交互式使用,并减少对昂贵云服务的依赖。
- 基于分片流水线构建工作流生成器,优先选用mistral-small,以低成本实现高成功率。
- 针对复杂JSON生成场景,引入分片生成策略,提升模型性能并降低失败率。
- 提供模型选择建议,帮助用户根据预算和性能要求,在成本与成功率间权衡。
- 利用延迟低于50秒的优势,开发实时交互式工作流设计工具。
仍待确认
- 论文未说明分片流水线在不同行业或非IT场景的泛化能力。
- 28个场景之外的多样性如何影响结果?
- 成本数据是否包含推理基础设施成本?
- 实际生产环境中,除结构成功率外的业务成功率如何?