- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月20日 14:58
- 状态
- 单一信源
发生了什么
研究者探讨了无需训练或语义对齐的异构大语言模型加权平均合并方法。他们通过维度适配将小模型扩展到大参数空间或将大模型截断到小参数空间,再以控制比例的插值进行加权平均。在Qwen系列模型对和多个基准测试中,小比例插值能够传递互补能力从而改进强源检查点,但近平衡插值常导致崩溃,且任务级结果呈现跷跷板效应。研究认为简单参数平均经轻量适配后是异构合并的强基线。
为什么重要
此前异构LLM合并依赖蒸馏、适配器、语义对齐等复杂技术,而本研究证明仅通过维度适配和比例控制的简单加权平均即可取得有竞争力结果,挑战了异构合并必须使用复杂方法的传统认知,可能降低模型合并的门槛。
底层逻辑
通过维度扩展或截断使不同参数空间的模型对齐到同一维度,然后使用加权平均(插值)直接合并参数。小比例插值(如0.1-0.3)允许目标模型从源模型吸收互补能力而不破坏自身核心功能;近平衡插值(如0.5)因参数空间不匹配导致功能崩溃。任务级跷跷板效应表明能力提升与衰退并存,说明简单合并难以全局最优。
产品与商业机会
对产品团队而言,此方法允许在无需训练或新增模块的前提下快速合并多个LLM检查点的能力,节省训练时间和算力成本。但跷跷板效应要求开发者针对目标场景仔细选择合并比例,并评估能力权衡,否则可能导致部分能力意外下降。
- 开发自动搜索最佳合并比例的工具,避免手动试错并最小化跷跷板效应的影响。
- 针对特定任务(如数学推理或代码生成)提供预设的小比例合并模板,快速增强单一能力。
- 探索在Qwen之外的其他模型家族验证此方法,以扩展适用性并形成标准合并流程。
仍待确认
- 该方法在非Qwen系列模型(如Llama、Gemma)上是否仍有类似表现?
- 跷跷板效应的根本原因是什么?能否通过加权平均以外的策略(如动态比例)缓解?
- 能否将多模型(≥3个)通过逐对合并组合为单个模型?比例控制如何扩展?
- 合并后的模型在长文本、多轮对话等复杂场景下的稳定性尚未被验证。