混合專家模型(MoE(LLM 中的主流架構))

混合專家模型(機器學習方法)

MoE(LLM 中的主流架構)一般指本詞條

本詞條是多義詞,共4個義項
更多義項 ▼ 收起列表 ▲

混合專家模型(Mixture of Experts,MoE)是一種神經網路架構,它通過一個門控網路(gating network)為每個輸入動態地選擇一小部分被稱為“專家”的子網路進行計算,從而以稀疏激活的方式提升模型容量與計算效率。該模型的核心理念源自1991年提出的“Adaptive Mixture of Local Experts”論文,通過訓練專家網路和門控網路實現條件計算。

MoE的核心特點在於其“高參數、低計算”的稀疏性,僅激活總參數的一小部分即可擴展模型規模,在不顯著增加浮點運算量的情況下容納更豐富的知識和更強的泛化能力,其優勢包括任務特異性、靈活性及高效性。該架構面臨負載均衡、專家間通信開銷、顯存要求高以及訓練複雜性等技術挑戰。MoE是超大規模語言模型(LLM)的重要套用架構之一,相關模型包括谷歌的GLaM、Switch Transformer,以及開源的Mixtral和DeepSeek系列模型。2025年12月,有研究機構開源了採用新稀疏性方法以替代MoE架構的Circuit Sparsity模型,該模型具有較高的權重稀疏性,採用“極致稀疏與功能解耦”思路。

MoE架構的發展與大型語言模型(LLM)緊密相關,2017年有研究將MoE層套用於循環神經網路(RNN),為後續Transformer架構套用奠定了基礎。相關研究在2020年至2021年驗證了其在大規模模型中的可行性。2022年出現了首個套用稀疏MoE的多模態模型。2023年底至2024年,有國內公司發布了採用MoE架構的大模型並進行了商業化部署探索。2024年有模型採用多層稀疏MoE架構,2025年有新一代文本大模型採用了MoE架構。2025年底至2026年初,業界陸續提出了多種採用或改進MoE架構的模型,涉及不同參數規模、模態(如視覺-語言-動作)以及醫療等特定領域。該架構的套用領域已拓展至自然語言處理、計算機視覺等多個方向。

基本介紹

  • 中文名:混合專家模型
  • 外文名:MoE、Mixture of experts
  • 所屬學科:人工智慧
  • 特點:高參數、低計算
  • 核心思想:分治策略+條件計算
發展歷程,早期探索,谷歌推動,開源浪潮,特點,優點,挑戰,套用,技術框架,核心組件,關鍵系統,架構創新,挑戰與未來發展,定義概念,核心思想,稀疏激活,

發展歷程

早期探索

MoE模型背後的核心前提源於1991年的論文“Adaptive Mixture of Local Experts”。論文建議訓練一個由獨立網路組成的人工智慧系統,每個網路專門用於不同的訓練案例子集。這需要訓練“專家網路”本身和一個確定每個子任務應該使用哪個專家的門控網路。當與類似的傳統模型進行比較時,作者發現他們的實驗模型的訓練速度要快得多:它達到目標精度閾值的訓練次數是傳統模型的一半。
MoE模型真正在深度學習領域煥發生機的是由谷歌研究員Noam Shazeer等人於2017年將MoE層套用於循環神經網路(RNN)中,用於大規模語言建模和機器翻譯,並展示了其在不增加過多計算成本的情況下提升模型容量的潛力。為後續MoE在Transformer架構中的套用奠定了基礎。

谷歌推動

  • GShard (2020): 谷歌通過GShard系統,將MoE架構擴展至擁有超過6000億參數的翻譯模型 。GShard是一套用於在超大規模計算集群上進行分散式訓練的通用系統,它引入了“專家並行”的概念,將不同的專家分布在不同的計算設備上,解決了單台設備無法容納所有專家參數的問題。
  • Switch Transformer (2021): 在GShard的基礎上,谷歌提出Switch Transformer,對MoE架構進行了簡化和最佳化。採用了極度稀疏的路由策略——每次只將輸入路由到一個最合適的專家(top-1 gating)。不僅降低了計算和通信的複雜性,還有效解決了MoE訓練中的一些不穩定性問題,使得訓練過程更加高效和穩定。Switch Transformer的論文展示了其在萬億參數規模上的成功,並一度成為開源的首個基於MoE的語言模型,極大地激發了學界和業界對MoE的興趣。

開源浪潮

2023年底,法國初創公司Mistral AI發布的Mixtral 8x7B模型是一個高質量、高性能的開源MoE模型,其性能在多個基準測試中超越了更大規模的稠密模型,並且易於在消費級硬體上進行推理,獲得了開發者的廣泛採用。
2023年12月,稀宇科技宣布將發布國內首個MoE大模型。
2024年DeepSeek公司發布了Deepseek-moe和DeepSeek-V2等模型,不僅在模型性能上取得了突破,更在MoE的架構本身進行了創新,一系列的開源發布,使得MoE成為AI領域共同探索的前沿方向。
2024年1月,MiniMax發布了國內首個MoE大模型;同年4月,該公司開創了將MoE架構用於大規模商業化部署的先河。
2025年10月,MiniMax發布並開源新一代文本大模型M2,採用MoE架構,在權威的Artificial Analysis榜單中位列全球前五、開源第一。
2025年12月16日,英偉達發布了Nemotron 3系列開放模型,包括Nemotron 3 Nano(300億參數)、Super(1000億參數)和Ultra(5000億參數),其中Nemotron 3 Nano已上線Hugging Face,Super和Ultra預計2026年上半年推出。該系列模型採用混合MoE架構,在推理效率上實現了顯著提升。
2025年12月18日,北京大學、香港中文大學與至簡動力團隊提出了ManualVLA模型,這是一個基於MoE架構的視覺-語言-動作(VLA)模型,實現了從最終狀態自主生成說明書並完成操縱。
2025年12月20日,國家人工智慧套用中試基地(醫療)在浙江發布“安診兒醫療大模型”(AntAngelMed),這是一個1000億參數的開源醫療MoE模型,成為全球參數量最大的開源醫療大模型,並同步啟動開源社區,開放完整模型權重、推理代碼和工具鏈。
2025年12月26日,開源瀏覽器自動化項目BrowserUse發布了其首個自研大語言模型BU-30B-A3B-Preview,該模型採用混合專家(MoE)架構,總參數規模達30B,實際推理時僅激活3B參數,已開源並上傳至Hugging Face平台。
2026年1月,科大訊飛攻克了國產算力平台上MoE模型全鏈路訓練效率難題,將訓練效率從2025年3月對標A800的30%提升至93%,實現了在該領域從0到1的重大突破,其“訊飛星火”大模型也成為唯一基於全國產算力訓練的通用大模型。
2026年1月,DeepSeek公司通過署名論文曝光了其計畫發布的V4模型核心架構創新「Engram」模組,首次提出“條件記憶”新範式,通過“存算分離”設計將固定知識存儲於獨立模組實現高效檢索,讓原有模型專注動態推理,該模型計畫於2026年2月中旬發布。

特點

優點

  1. 高參數效率: 是MoE的核心優勢,實現了模型參數規模和計算成本的有效解耦。在有限的算力下,訓練出參數量遠超以往的模型。
  2. 英偉達於2025年12月發布的Nemotron 3 Nano模型,採用混合MoE架構,實現了最高4倍的Token吞吐量提升,並將推理階段生成的Token數量減少最高60%,顯著降低推理成本。此外,英偉達在Nemotron 3 Super和Ultra模型中採用的NVFP4格式,進一步提升了存儲和推理效率。2025年10月,MiniMax發布並開源的新一代文本大模型M2採用MoE架構,在權威評測中位列全球前五。類似地,其他採用MoE架構的模型也展示了這一優勢,例如BU-30B-A3B-Preview模型總參數達300億,但推理時僅激活30億參數,顯著降低了對計算資源的需求。2026年1月,中科天璣發布的“社會認知大模型”採用任務級混合專家架構,在國產化全棧適配最佳化下,滿足了高並發、低延遲的實戰性能要求。同樣,科大訊飛於2026年1月攻克了MoE模型在國產算力平台上的全鏈路訓練效率難題,將其訓練效率從對標A800的30%大幅提升至93%,實現了在該領域從0到1的重大突破。2026年1月,DeepSeek V4引入的Engram模組,通過“存算分離”設計將靜態知識外掛,在等參數/等算力測試中相比純MoE模型,知識任務(MMLU、CMMLU)準確率提升3.4%-4.0%,推理任務(BBH、MATH)提升2.4%-5.0%,代碼能力(HumanEval)提升3.0%;同時記憶表可預載至主機記憶體或SSD,幾乎不增加GPU顯存壓力,降低部署成本,據稱訓練成本或可降低50%。
  3. 專家專業化: MoE的結構支持模型學習專門化知識。在訓練過程中,不同的專家可以自發地學會處理不同類型的數據、語言、主題或邏輯模式。 以Nemotron 3系列為例,其Nano模型專注於高效推理和邊緣設備部署,Super模型擅長多智慧型體套用,Ultra模型適用於複雜推理場景,體現了不同專家處理不同類型任務的能力。
  4. 更快的訓練收斂:在達到相同模型質量的情況下,MoE模型通常比同等計算量的稠密模型收斂得更快。實驗顯示訓練速度達到目標精度閾值的次數是傳統模型的一半。

挑戰

  1. 訓練不穩定性與負載均衡: 門控網路是MoE的“大腦”,但它的決策也可能帶來問題。一個常見的現象是“富者愈富”,即門控網路傾向於將大量輸入路由到少數幾個專家,導致這些專家過載,而其他專家則因訓練不足而“餓死”。為了解決該問題,研究者通常會引入一個額外的“負載均衡損失函式”,以激勵門控網路將輸入更均勻地分配給所有專家 。
  2. 高通信開銷: 在分散式訓練中,專家被分散在不同的計算節點(GPU/TPU)上。當一個節點上的輸入需要由另一個節點上的專家處理時,就必須進行跨節點的數據和參數通信。這種“All-to-All”的通信模式會成為訓練速度的瓶頸,尤其是在網路頻寬有限的情況下 。
  3. 推理部署複雜性: MoE在推理時計算量不大,但對記憶體(顯存)的需求高。在推理時,所有的專家參數都必須載入到記憶體中,以備隨時被門控網路調用。
  4. 微調難度:在微調過程中,可能會出現“專家災難性遺忘”或“專業化崩潰”等問題,需要專門的策略來維護模型的性能。

套用

超大規模語言模型(LLM)是混合專家模型(MoE)最核心和成功的套用領域。相關模型包括谷歌的GLaM、Switch Transformer,以及開源的Mixtral和DeepSeek等系列。2025年12月,英偉達發布的Nemotron 3系列模型進一步擴展了MoE的套用,包括適用於軟體調試、內容摘要、AI助手工作流和信息檢索等任務的Nano模型,以及面向多智慧型體套用和複雜AI工作流的Super和Ultra模型。該系列模型覆蓋從邊緣計算到複雜推理的多種場景。
此外,稀宇科技(MiniMax)也採用混合專家(MoE)架構,推出了ABAB系列大模型及Glow、海螺AI等套用產品,覆蓋文本、語音、視覺多模態。其產品包括語音模型Speech-02、視頻模型Hailuo-02及文本模型MiniMax M2。
在機器人視覺-語言-動作任務中,混合專家模型也被套用,用於處理長程操縱任務,如物體搭建和重排。
在醫療領域,混合專家模型同樣展現出套用潛力。例如,2025年12月發布的安診兒醫療大模型(AntAngelMed)採用MoE架構,已落地心臟健康和青少年心理等場景。
在瀏覽器自動化領域,混合專家模型也有套用。例如,2025年12月,開源項目BrowserUse發布了基於MoE架構的BU-30B-A3B-Preview模型,該模型專為瀏覽器自動化場景最佳化,支持多模態輸入。

技術框架

核心組件

MoE層通常嵌入在Transformer塊中以替代標準的前饋網路(FFN)層,其主要由以下部分構成:
  • 專家網路(Experts): 是一組並行的、結構相同的神經網路。在Transformer中,每個專家就是一個兩層的多層感知機(MLP)。它們的結構一樣,但權重參數是獨立訓練、互不共享的。
  • 門控網路(Gating Network): 是一個小型的神經網路,通常是一個簡單的線性層加上一個Softmax激活函式 。它接收來自上一層的token隱藏狀態作為輸入,輸出一個覆蓋所有專家的機率分布。這個分布表明了每個專家處理當前token的“適合度”。
  • 路由策略(Routing Strategy): 門控網路輸出機率後,系統根據預設的策略選擇激活哪些專家。最常見的策略是“Top-k”,即選擇機率最高的k個專家。輸入token的向量會乘以其對應的門控權重,然後被送入選定的專家中進行計算。最後,所有被激活專家的輸出會根據門控權重加權求和,形成該MoE層的最終輸出。

關鍵系統

  • GShard:GShard的核心是解決了MoE模型的並行化問題。允許將模型的不同部分“分片”到數千個加速器上。其“專家並行”策略將專家均勻分配到所有設備,而數據則在設備間根據門控決策進行動態路由。
  • Switch Transformer: 將路由策略簡化為top-1,減少了計算和通信的冗餘。
  • DeepSpeed-MoE: 提供了一個端到端的解決方案,覆蓋了訓練和推理的全流程 。DeepSpeed-MoE通過引入新的並行策略和高度最佳化的通信算法,降低訓練MoE模型的硬體門檻和成本。在推理方面,提供了專門的最佳化,解決MoE模型記憶體占用大的問題,讓用戶能夠部署和使用大型MoE模型。

架構創新

Nemotron 3系列模型採用Mamba-Transformer混合MoE架構,在實現業界領先吞吐率的同時,具體而言,吞吐量比Nemotron 2 Nano提升4倍。其準確率優於或不遜於傳統Transformer模型。該架構大量採用MoE層與成本更低的Mamba-2層交替堆疊,在Nemotron 3 Nano模型中,MoE架構具體使用了128個專家,實現了高效推理。避免了傳統自注意力層中KV Cache線性增長的問題。同時,模型引入LatentMoE架構,通過將token投影到更小的潛在維度進行專家路由和計算,減少專家權重載入和通信成本。多Token預測技術被用於提升模型準確率和推理效率,並通過極少量額外FLOPs帶來speculative decoding加速收益。NVFP4低精度訓練格式實現了在Mamba–MoE混合架構上對最高25萬億tokens的穩定預訓練,峰值吞吐量是FP8的3倍。此外,模型支持100萬token超長上下文視窗,通過避免使用旋轉位置編碼(RoPE)來克服上下文擴展限制。
在機器人領域,北京大學等團隊提出的ManualVLA模型採用Mixture-of-Transformers(MoT)架構,統一了規劃專家和動作專家,通過ManualCoT思維鏈機制結合顯式(視覺提示)和隱式(潛在表征)路徑指導動作生成,並在長時序任務中平均成功率相較於基線方法提升約32%。
2026年1月7日,中科天璣數據科技股份有限公司研發的社會認知大模型通過國家生成式人工智慧服務備案。該模型採用了任務級混合專家架構,實現領域分析效率提升30%以上。模型構建了熱冷雙軌知識增強機制,並實現了面向多模態內容分析的跨模態語義對齊。此外,模型完成了覆蓋底層國產硬體適配、訓練框架最佳化到上層套用部署的全鏈路國產化適配。
2026年1月14日,DeepSeek V4的核心架構創新“Engram”模組曝光。該架構首次提出“條件記憶”新範式,採用存算分離設計,通過哈希N-gram技術實現高效知識檢索,並遵循U型縮放定律以平衡計算與記憶資源。在等參數規模測試中,該架構在MMLU、CMMLU等知識基準測試上的準確率有所提升。

挑戰與未來發展

OpenAI於2025年12月14日開源了Circuit Sparsity模型,該模型具有99.9%的權重稀疏性,採用了一種新的稀疏性方法以替代混合專家(MoE)架構。該技術旨在通過約束模型內部連線的稀疏性來提升AI模型的可解釋性,以應對傳統稠密Transformer模型存在的“黑箱”問題。與MoE通過專家路由實現近似稀疏性的方式相比,Circuit Sparsity追求的是原生稀疏性。有觀點認為,Circuit Sparsity所採用的“極致稀疏與功能解耦”思路可能對MoE架構的發展構成挑戰。然而,Circuit Sparsity目前面臨較高的算力成本,其訓練和推理計算量約為傳統模型的100至1000倍,暫時未能達到頂尖大模型的性能水平。開發團隊計畫未來將該技術擴展至更大規模的模型,以探索更複雜的推理電路。與此同時,英偉達在2025年12月16日發布了Nemotron 3系列模型,該系列採用混合MoE架構,旨在應對高通信開銷、上下文漂移及推理成本等挑戰。該系列包含Nemotron 3 Nano、Super和Ultra三個規格。其中,Nano規格已發布,採用Mamba-Transformer混合MoE架構,支持100萬token的上下文視窗,並在推理效率上有所提升;Super和Ultra規格計畫於2026年上半年發布,預計將引入更先進的Latent MoE技術和NVFP4數據格式。Nemotron 3系列為構建專業級智慧型體提供了相應的性能與開放性。英偉達通過推廣Mamba架構與NVFP4格式,構建其AI生態系統;同時,該系列開源了模型權重、訓練數據及強化學習環境。史丹福大學計算機科學副教授Percy Liang指出,Nemotron公開訓練數據、強化學習環境和訓練代碼的做法,使用戶能夠創建自己的模型,體現了開放式創新的重要性。
2025年12月26日,開源瀏覽器自動化項目BrowserUse發布了其首個自研大語言模型BU-30B-A3B-Preview。該模型採用混合專家(MoE)架構,據稱每消耗1美元計算資源可完成約200個瀏覽器任務。該模型已完全開源。
2026年1月7日,中科天璣數據科技股份有限公司的社會認知大模型通過國家生成式人工智慧服務備案,並獲批北京市“新技術新產品首次進入市場支持項目”。該模型採用任務級混合專家架構,專注於輿情分析、內容治理等垂直領域。

定義概念

混合專家模型(MoE)借鑑了“分而治之”的思想,將一個複雜的任務分解給多個專門化的子模組(專家)來協同完成。在大模型時代,它是突破稠密模型縮放瓶頸的關鍵技術之一。

核心思想

MoE架構的核心思想可以概括為:條件計算(Conditional Computation)。傳統模型無論輸入是什麼,都執行完全相同的計算流程,動用所有參數。而MoE模型則根據輸入數據的特性,有選擇性地激活一部分計算路徑。其結構主要由兩部分組成:
  1. 專家網路(Experts): 是一組結構相同但參數獨立的神經網路。在Transformer架構中,表現為多個並行的前饋神經網路(FFN)層 。每個專家可以被視為在某個特定領域或數據模式上具有專長的模型。
  2. 門控網路(Gating Network): 是一個輕量級的路由或調度網路。作用是分析輸入,然後決定將這個輸入傳送給哪些專家進行處理。門控網路會為每個專家生成一個權重或機率,得分最高的少數專家將被激活 。
整個工作流程像一個項目團隊:項目經理(門控網路)拿到一項任務(輸入數據)後,不會讓所有團隊成員(所有專家)都參與,而是根據任務的性質,挑選最合適的幾位專家來完成,最後將他們的成果(輸出)整合起來,形成最終的解決方案。

稀疏激活

稀疏激活是MoE實現計算效率的關鍵。擁有數千億參數的MoE模型,對於任意一個輸入token的計算,可能僅激活其中百億級別的參數。“稀疏性”帶來了兩個好處:
  1. 參數規模與計算量解耦: 模型的總參數量(代表其知識容量)可以持續增長,而單次推理的計算量(FLOPs)僅與被激活的專家數量有關,增長緩慢 。
  2. 提升模型容量:大參數量意味著模型有潛力學習到更複雜、更細緻的模式和知識,從而在各類任務上取得更好的表現。

相關詞條

熱門詞條

聯絡我們