Mixtral 8x22B是法國Mistral AI公司於2024年4月開源的稀疏混合專家(SMoE)架構對話模型。該模型總參數量達1410億(活躍參數390億),支持64K token長文本處理與英法德等五國語言互動,採用Apache 2.0許可協定允許無限制商用。在MMLU、HellaSwag等基準測試中超越LLaMA-2 70B模型,數學推理與編程能力達到行業領先水平。截至2024年6月,該模型已在Azure AI平台獲得商業套用,並參與國內首個AI高考全卷評測。
基本介紹
- 開發者:Mistral AI
- 發布時間:2024年4月17日
- 參數規模:1410億(活躍390億)
- 開源協定:Apache 2.0
- 語言支持:5種(英語、法語、義大利語、德語、西班牙語)
- 上下文視窗:64K token
技術架構
- 採用稀疏混合專家架構(SMoE),每個前饋模組包含8個專家層
- 通過動態激活部分參數實現高效運算,推理時僅需載入約390億參數量
- 延續Mixtral 8x7B設計思路,將Transformer中的前饋網路替換為專家模組
開源特性
- 2024年4月17日通過Torrent渠道開源,包含基礎版與指令調優版
- 模型權重可在Hugging Face、Perplexity AI Labs等平台獲取
- 部署需258GB顯存,支持Ollama+Open WebUI組合部署方案
性能評測
- 在MMLU基準測試取得77.5分,超過Qwen1.5-72B-Chat模型
- 多語言處理能力達到英語77.5%、法語表現突出
- 微軟基於本模型訓練的WizardLM-2 8x22B版本在MT-Bench評分超過早期GPT-4
套用場景
- 支持函式調用功能,配合la Plateforme平台實現受限輸出模式
- 2024年6月高考評測顯示,英語作文生成存在超字數扣分現象
- 支持大型文檔信息提取,適用於金融分析、代碼生成等專業領域
行業影響
- 成為Llama 3、Phi-3等同期模型的技術對標對象
- 微軟將其納入Azure AI平台服務體系,驗證商用可行性
- 開發者社區評價其為"開源LLM領域新標桿",推動MoE架構普及
