Awesome-Mixture-of-Experts-Papers路由策略全盘点Top-k、Expert Choice与Hash Layers对比【免费下载链接】Awesome-Mixture-of-Experts-PapersA curated reading list of research in Mixture-of-Experts(MoE).项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers在混合专家模型Mixture-of-Experts简称 MoE成为大模型规模化训练主流方案的今天**路由策略Routing Strategy**直接决定了每个 token 该交给哪些专家处理是影响模型精度、训练效率与稳定性的核心机制。Awesome-Mixture-of-Experts-Papers正是一份帮你系统掌握 MoE 研究的精选论文清单按算法、系统与应用三大板块收录了近年所有关键工作。本文基于这份清单带你一次看懂三种最具代表性的路由策略——Top-k、Expert Choice 与 Hash Layers并给出横向对比与入门学习路线。为什么说路由策略是 MoE 的灵魂MoE 的核心思想是稀疏激活将一个大模型拆成多个专家网络Expert由路由器Router / Gate为每个输入 token 挑选少数几个专家参与计算。这样既能把参数量做到万亿级又能保持单次推理的算力开销可控。路由策略要同时回答三个问题1️⃣谁来算这个 token 交给哪几个专家 2️⃣算多重的权重每个专家的输出如何加权合并 3️⃣怎么不挤爆如何避免所有 token 都涌向同一批热门专家造成负载不均与训练崩溃在 README.md 的 Algorithm 板块中收录了 2017 年至 2022 年间几乎所有路由策略的代表性论文从经典门控到最新的 Expert Choice 一应俱全是理解这一领域的最佳地图。Top-k 路由经典门控开启稀疏时代Top-k 是最早、也是最广为人知的路由策略思路非常直观让每个 token 主动去竞选专家得分最高的 k 个专家胜出。**2017 年《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》**提出了带噪声的 Top-k 稀疏门控首次把 MoE 层应用到百万级词汇的语言模型上被视为 MoE 的开山之作收录于 README.md。2021 年 Switch Transformers将 k 简化到 1Top-1 路由用简化到极致的思路把稀疏激活模型推向万亿参数收录于 README.md。GShard则采用 Top-2 路由并引入辅助负载均衡损失让 token 在专家间的分布更均匀收录于 README.md。✅优点可学习、自适应性强能根据数据分布动态调整专家分工理论表达力高。 ❌缺点负载不均衡是老大难问题当 token 被路由到的专家过载时部分 token 会被直接丢弃Token Dropping且训练过程对超参数敏感、稳定性欠佳。Expert Choice 路由让专家反向挑选 Token2022 年提出的《Mixture-of-Experts with Expert Choice Routing》收录于 README.md彻底反转了决策方向不再由 token 挑选专家而是让每个专家反向挑选亲和度最高的 top-k 个 token。这个看似简单的换位思考带来了三个显著收益✅负载完美均衡每个专家处理的 token 数量完全一致无需辅助损失即可消除负载不均✅零 token 丢弃所有 token 都会被至少一个专家处理信息不丢失✅训练吞吐大幅提升实验表明训练速度可达传统 Top-1 路由的 2 倍以上。❌缺点一个 token 可能被多个专家重复处理导致计算放大因此不适合自回归解码等对实时性要求高的推理场景更适用于编码器或训练阶段。Hash Layers 路由零参数、确定性的笨办法2021 年 NeurIPS 论文《Hash Layers For Large Sparse Models》收录于 README.md提供了另一种极致简洁的思路不学习任何路由参数直接用哈希函数把 token 的特征如 token id 层号映射到某个专家。✅优点完全确定性可复现、训练极其稳定无路由参数省显存、省训练开销天然避免负载不均衡与 token 丢弃问题。❌缺点哈希映射与数据分布无关不具备自适应性专家容量利用率与最终精度通常不如可学习路由更适合作对比基线与大规模基线实验。三大路由策略横向对比表对比维度Top-k 路由Expert Choice 路由Hash Layers 路由代表论文Sparsely-Gated MoE2017、Switch2021Expert Choice Routing2022Hash Layers2021决策方向Token 选专家专家选 Token哈希函数指定是否可学习✅ 可学习✅ 可学习❌ 零参数负载均衡差需辅助损失完美均衡天然均衡Token 丢弃可能发生不会发生不会发生训练稳定性较弱强最强推理友好度高低不适用自回归高适用场景通用大模型预训练编码器、训练提速基线对比、超大规模扩展一句话总结要精度选 Top-k要吞吐选 Expert Choice要稳定与简单选 Hash Layers。扩展阅读还有哪些值得关注的路由研究除了三大主流策略这份清单还收录了不少重要变体值得顺藤摸瓜BASE LayersICML 2021把路由问题转化为线性分配问题实现全局最优的负载均衡见 README.mdStableMoEACL 2022提出稳定路由策略让训练与推理时的路由保持一致见 README.mdDSelect-kNeurIPS 2021可微分的专家选择方法面向多任务学习场景见 README.mdST-MoE2022系统性地解决了稀疏专家模型的训练稳定性与迁移性问题见 README.mdGLaM2021Google 的 1.2 万亿参数 MoE 语言模型展示了稀疏激活在效率上的巨大优势见 README.md。结合开源系统的高效学习路线只看论文还不够README 末尾的Open-Source System板块见 README.md还收录了Tutel、FastMoE、DeepSpeed-MoE、HetuMoE等主流开源实现建议按以下三步走入门精读 Sparsely-Gated MoE2017与 Switch Transformers2021理解 Top-k 门控与负载均衡损失进阶对比 BASE Layers、Hash Layers 与 Expert Choice亲手复现一张上述对比表实践用 Tutel 或 FastMoE 跑一个小规模 MoE 模型把三种路由策略替换上去直观感受吞吐与精度的差异。想本地查阅全部论文条目只需克隆仓库git clone https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers小结路由策略是 MoE 从能用走向好用的关键一环Top-k 奠定了稀疏激活的基础Expert Choice 用方向反转换来了负载均衡与训练加速Hash Layers 则以零参数换取了极致的简单与稳定。Awesome-Mixture-of-Experts-Papers 把这一演化脉络完整地收纳在一份清单中无论你是刚接触 MoE 的新手还是想跟进最新路由研究的进阶者都值得把它当作案头的第一份参考资料。【免费下载链接】Awesome-Mixture-of-Experts-PapersA curated reading list of research in Mixture-of-Experts(MoE).项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考