面向动态稀疏混合专家模型的分布一致推理
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
混合专家架构在扩大大模型容量的同时保持高效推理,已成为重要范式。但多数模型采用固定的专家选择策略,为每个词元分配相同的专家预算,即使更少的专家已足够。推理时动态调整激活专家数量可在不重训练的情况下降低计算量,然而现有方法常忽视偏离训练时路由配置所带来的分布偏移。该研究表明,减少激活专家数量会持续提高稀疏混合专家模型输出的均方根尺度与方差,造成表示不匹配,除专家容量损失外还导致下游性能下降。为此作者提出层级分布对齐,一种轻量级推理时校正方法,利用逐层校准统计量,使减少路由后的表示与默认配置对齐。在多种稀疏混合专家大语言模型、基准与路由策略上,该方法在几乎不增加开销的情况下恢复了因分布偏移而损失的大部分性能,同时保持稀疏推理效率。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。固定 top-k 的局限
多数混合专家(MoE)模型采用固定 top-k 专家选择策略,为每个 token 分配相同专家预算,即使更少专家可能已经足够。
动态路由的潜力与盲点
推理时动态 top-k 路由可在不重新训练的情况下减少计算,但现有方法常忽略偏离训练时路由配置所导致的分布偏移。
分布偏移现象
作者发现,减少激活专家数量会持续提高 SMoE 输出的 RMS 尺度和方差。
性能退化机制
上述变化造成表示不匹配,并在专家容量损失之外,进一步导致下游性能退化。
提出 LDA 方法
作者提出逐层分布对齐(LDA),一种轻量级推理时校正,使用逐层校准统计量,将减少路由的表示与默认配置对齐。
实验效果
在多个 SMoE 大语言模型、基准和路由策略上,LDA 恢复了减少路由下因分布偏移而损失的大部分性能,同时保持稀疏推理效率且开销可忽略。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09241