![[論文筆記] mixSGA HMoE BrownoutMoE](http://pic.xiahunao.cn/yaotu/[論文筆記] mixSGA HMoE BrownoutMoE)
三篇 MoE 相關論文對比梳理三篇論文分別從注意力層 KV 緩存優化、異構專家架構設計、MoE 線上推理服務部署優化三個不同維度對混合專家模型做創新下面分別解析核心思想、創新點、差異對比。1. Mixture of Weight?shared Heterogeneous Group Attention Experts for Dynamic Token?wise KV OptimizationEMNLP 2025mixSGA基于共享權重的異構組注意力專家混合模型用于動態逐令牌鍵值優化問題背景大模型推理 KV 緩存占用內存巨大GQA 等靜態分組 KV 方案采用固定分組粒度無法適配不同 token 的重要程度要么丟棄低優先級 token要么統一粗粒度分組造成性能損失。核心方案 mixSGA把 MoE 思想應用到注意力模塊不是 FFN 專家構建一組異構分組注意力專家各個專家擁有不同 KV 分組大小。逐 token 專家選擇路由依據學習得到 token 重要性分數把不同 token 路由到不同 KV 粒度的注意力專家保留全部 token不做丟棄重要 token 分配細粒度 KV普通 token 分配粗粒度 KV。專家之間權重共享注意力投影層權重共享控制參數量開銷。輔助損失函數約束路由接近 one?hot保證訓練、推理行為一致。實驗效果在相同 KV 緩存預算下Llama3、OPT、Gemma2 等模型上指令微調、繼續預訓練任務獲得更低困惑度、更高 ROUGE?L降低 KV 內存占用優化注意力計算開銷。定位注意力層架構創新解決 KV Cache 內存瓶頸。2. HMoE: Heterogeneous Mixture of Experts for Language Modeling用于語言建模的異構專家混合模型問題背景傳統 MoE 全部使用同尺寸專家但輸入 token 語義復雜度差異巨大簡單 token 和復雜 token 需要的模型容量不一樣同構專家很難適配不同難度樣本參數利用效率低。核心方案 HMoEFFN 專家采用異構尺寸專家網絡大小各不相同具備不同模型容量。支持 Top?K固定激活專家數量、Top?P動態自適應激活專家數量兩種路由復雜 token 分配到大容量專家簡單 token 分配小容量專家。專門設計訓練損失提升小專家被激活概率緩解異構專家帶來的激活負載不均衡。實驗效果同等激活參數量下相比傳統同構 MoE 獲得更好語言建模性能同等性能下降低計算 FLOPs。定位Transformer FFN 層架構創新改變專家本身網絡大小異構專家原生模型架構。3. BrownoutMoE: Structure?Aware Expert Grouping for Efficient and Accurate LLM Web?based ServicesarXiv:2607.04164面向結構感知的專家分組實現高效且準確的基于 Web 的 LLM 服務arXiv問題背景MoE 在線 Web 服務存在專家訪問嚴重傾斜少量熱專家處理絕大多數 token大量冷專家極少被調用GPU 利用率低。之前 BrownoutServe 采用按索引順序簡單合并專家為聯合專家 (united expert)會把行為差異大專家合并蒸餾后精度損失大。核心方案 BrownoutMoE面向線上推理服務系統優化離線對原始專家做分組合并蒸餾在線做 SLO 感知動態降載brownout 降壓保供范式。將分層專家分組建模為離散策略優化問題使用GRPO 強化學習搜索最優分組初始化依靠專家輸出相似度層次聚類優先把行為相似專家劃分同一組。兩階段流水線GRPO 搜索分組策略 → 分組一致知識蒸餾得到可部署聯合專家模型。控制平面 SLO 感知延遲控制器線上根據 P90 延遲動態調整閾值冷專家 token 可路由到蒸餾后的聯合專家犧牲少量精度保障響應時延 SLO。實驗效果對比順序分組基線精度退化最高減少 71.4%吞吐最高提升 2.24×基于 Qwen1.5?MoE?A2.7B 驗證。定位MoE 推理服務系統優化不修改原生 MoE 網絡結構后處理方式對已有訓練完成 MoE 模型做專家合并蒸餾面向 Web 線上部署。三篇論文關鍵差異總表表格論文優化對象創新層面是否修改原生模型架構核心技術目標收益mixSGAAttention 注意力層 KV 緩存模型架構?修改注意力模塊異構分組注意力專家、token?wise 路由、權重共享降低 KV Cache 內存開銷HMoEFFN 專家網絡模型架構?修改 FFN 專家尺寸大小異構 FFN 專家、異構路由損失提升參數利用率、降低 FLOPsBrownoutMoEMoE 推理部署服務系統 后訓練蒸餾?不改動原生模型離線做專家合并蒸餾GRPO 專家分組搜索、聯合專家蒸餾、SLO?aware brownout 控制提升線上推理吞吐保障服務時延 SLO控制精度損失補充區分要點mixSGA 把 MoE 思想遷移到注意力HMoE、BrownoutMoE 聚焦傳統 FFN MoEHMoE 是訓練階段原生異構專家架構BrownoutMoE 是對已經訓練好的 MoE 做后處理屬于服務側優化BrownoutMoE 繼承 BrownoutServe 的聯合專家與 brownout 降載思想解決它順序分組帶來精度損失的短板。