- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年7月21日 00:00
- 状态
- 单一信源
发生了什么
NexForge是一个需求驱动的任务合成框架,能从高层次能力需求生成可执行的agent任务和专家轨迹,用于LLM监督微调。它无需领域特定基础设施,自动编译文件、依赖等实例化任务。使用其生成的3,600个终端任务和2,000个办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上的准确率从22.5%提升至52.0%,GDPval Elo从813提升至1338。扩展到43.2K任务后进一步提升至58.4%,超越Claude Opus 4.6。基于此训练的Nex-N2模型在Terminal-Bench 2.1上达到75.3%,GDPval Elo 1585,成为开源最佳,超越部分闭源系统。
为什么重要
此前任务合成受限于固定工具或技能图,扩展需要人工工程和定制基础设施,且分布存在偏差。NexForge通过需求描述直接合成任务,无需手动构建底层资源,大幅降低了扩展agent训练数据的门槛和成本。
底层逻辑
NexForge先分析真实需求生成场景和任务模板,采样任务形式,再通过分布感知编译自动检索或构建文件、仓库、依赖等来实例化任务,最后合成专家轨迹并蒸馏。该机制将任务合成从“资源限制”转向“需求驱动”。
产品与商业机会
开发AI agent产品的团队可借鉴NexForge方法,快速生成大量高质量训练数据,省去构建和维护工具、仓库等基础设施的工程成本。Nex-N2模型作为开源模型可直接用于构建agent应用,降低对闭源模型的依赖。
- 使用类似NexForge的需求驱动方式,为特定垂直领域(如客服、代码开发)自动生成agent训练数据,提升模型在该领域的任务执行能力。
- 集成Nex-N2开源模型到产品中,替代部分闭源模型以降低成本并增加自主可控性。
- 开发基于需求驱动的自动化数据合成流水线产品,作为服务提供给其他需要训练agent的AI公司。
仍待确认
- NexForge框架和Nex-N2模型是否已开源或可通过API获取?
- 该方法在其他领域(如图像处理、物理机器人)是否同样有效?
- 合成的任务是否存在质量或覆盖偏差,如何评估和修正?
- 在真实用户环境中的表现与论文中基准测试的差距有多大?