Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance

一、文章主要内容

论文针对大型语言模型(LLMs)训练资源密集、耗时的问题,提出一种名为Soup Of Category Experts(SoCE) 的模型融合(model souping)技术。该方法利用基准测试的类别构成特性,通过分析不同类别间的性能相关性,筛选各弱相关类别集群的“专家模型”,再通过非均匀加权平均融合这些模型的权重,无需昂贵的重新训练即可提升模型性能与稳健性。实验验证了SoCE在多领域的有效性,包括工具调用(BFCL基准)、多语言数学推理(MGSM基准)、长上下文处理(∞-Bench基准)等,在伯克利函数调用排行榜(BFCL)上取得state-of-the-art(SOTA)结果,同时提升了模型在不同任务类别间的性能一致性。

二、核心创新点

  1. 类别感知的自动专家选择:突破传统均匀加权融合的局限,利用基准测试类别间的低相关性,自动识别各类别“专家模型”,针对性整合互补能力;
  2. 非均匀加权优化:通过权重搜索(0.1-0.9步长)优化融合权重,最大化整体性能,相比均匀加权和仅选模型不优化权重的方案,显著提升效果;
  3. 性能与一致性双提升:不仅在多基准测试中超越现有基线和单个模型,还通过Pearson相关性分析验证,融合后的模型在不同类别任务上的性能一致性更强;
  4. 理论支撑与实证验证:结合合作博弈论的Shapley值分析模型贡献,量化专家模型的作用,同时在70B和8B参数模型上完成大规模实验,验证方法的泛化性。<
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值