一、文章主要内容
论文针对大型语言模型(LLMs)训练资源密集、耗时的问题,提出一种名为Soup Of Category Experts(SoCE) 的模型融合(model souping)技术。该方法利用基准测试的类别构成特性,通过分析不同类别间的性能相关性,筛选各弱相关类别集群的“专家模型”,再通过非均匀加权平均融合这些模型的权重,无需昂贵的重新训练即可提升模型性能与稳健性。实验验证了SoCE在多领域的有效性,包括工具调用(BFCL基准)、多语言数学推理(MGSM基准)、长上下文处理(∞-Bench基准)等,在伯克利函数调用排行榜(BFCL)上取得state-of-the-art(SOTA)结果,同时提升了模型在不同任务类别间的性能一致性。
二、核心创新点
- 类别感知的自动专家选择:突破传统均匀加权融合的局限,利用基准测试类别间的低相关性,自动识别各类别“专家模型”,针对性整合互补能力;
- 非均匀加权优化:通过权重搜索(0.1-0.9步长)优化融合权重,最大化整体性能,相比均匀加权和仅选模型不优化权重的方案,显著提升效果;
- 性能与一致性双提升:不仅在多基准测试中超越现有基线和单个模型,还通过Pearson相关性分析验证,融合后的模型在不同类别任务上的性能一致性更强;
- 理论支撑与实证验证:结合合作博弈论的Shapley值分析模型贡献,量化专家模型的作用,同时在70B和8B参数模型上完成大规模实验,验证方法的泛化性。<
订阅专栏 解锁全文

227

被折叠的 条评论
为什么被折叠?



