MoE 奖励模型可解释性新突破:贡献对比法让打分逻辑透明
一篇新论文提出 Contribution Contrast(贡献对比)方法,在响应级别上对 MoE 奖励模型的打分逻辑做忠实归因——不再依赖路由权重,而是逐专家计算边际贡献,回答“这个分数为什么是这样”。
注:以上为论文核心概念的量级示意,具体技术细节以论文原文为准。
一篇新论文提出 Contribution Contrast(贡献对比)方法,在响应级别上对 MoE 奖励模型的打分逻辑做忠实归因——不再依赖路由权重,而是逐专家计算边际贡献,回答“这个分数为什么是这样”。
注:以上为论文核心概念的量级示意,具体技术细节以论文原文为准。
MoE(Mixture of Experts)奖励模型,是当前 RLHF 对齐流程中的关键组件。它由一组专家网络与一个路由器构成——每个 token 被路由器分配给不同的专家处理,最终汇聚成一个奖励分数,用来指导策略模型优化。
但一个尴尬的问题长期存在:
当奖励模型打出一个低分时,我们只知道“它不喜欢这个输出”,却不知道“它具体为什么不满意”。现有解释方法几乎都盯着路由权重——看哪些专家被激活的权重高,就认为哪些专家在起作用。但论文指出,路由权重本质上是“调度信号”,描述的是 token 被分给了谁,而不是谁对最终分数产生了实际影响。
权重高 ≠ 贡献大。就这么简单。
看哪个专家被激活、权重多高。但高权重可能只是调度偏好,不代表实际决策影响力。
逐专家算边际贡献,揭示“谁真正改变了分数”,并处理专家间的交互效应。
注:左列为现有主流解释方式的简化模型,右列为论文提出的新方法定位。
贡献对比的核心思想很直接:通过对比每个专家“在场”和“不在场”时模型输出的分数差异,来量化它对最终打分的边际贡献。这类似博弈论中 Shapley 值的思路,但被简化并适配到奖励模型的响应级解释上。
一个响应,就是一条完整的解释链。
与路由权重不同,贡献对比回答的是“谁真正改变了分数”,而不是“谁被调用了”。这保证了解释与模型决策过程的一致性——也就是论文标题中 “Faithful” 一词的含义。
它不是代理指标,它是决策本身的一幅解剖图。
注:流程为论文方法的简化示意,完整算法细节见论文原文。
如果用一组关键词来概括这篇论文的贡献,它们会是这样——越大的字号,代表越核心的命题。
注:标签按论文关键词权重排列,字号越大代表在方法中越核心。
奖励模型的可解释性,正在从“看路由表”走向“算贡献值”。当每个专家对分数的贡献可以被量化,RLHF 就不再只是“炼丹”——它第一次有了可审计、可调试的工程基础。
论文已公开发布,在学术预印本平台检索论文标题即可阅读完整原文。
方法代码与实验细节以论文附录为准。