Mixtral 8x22B

Mixtral 8x22B是法國Mistral AI公司於2024年4月開源的稀疏混合專家(SMoE)架構對話模型。該模型總參數量達1410億(活躍參數390億),支持64K token長文本處理與英法德等五國語言互動,採用Apache 2.0許可協定允許無限制商用。在MMLU、HellaSwag等基準測試中超越LLaMA-2 70B模型,數學推理與編程能力達到行業領先水平。截至2024年6月,該模型已在Azure AI平台獲得商業套用,並參與國內首個AI高考全卷評測。

基本介紹

  • 開發者:Mistral AI 
  • 發布時間:2024年4月17日
  • 參數規模:1410億(活躍390億) 
  • 開源協定:Apache 2.0 
  • 語言支持:5種(英語、法語、義大利語、德語、西班牙語)
  • 上下文視窗:64K token 
技術架構,開源特性,性能評測,套用場景,行業影響,

技術架構

  • 採用稀疏混合專家架構(SMoE),每個前饋模組包含8個專家層
  • 通過動態激活部分參數實現高效運算,推理時僅需載入約390億參數量
  • 延續Mixtral 8x7B設計思路,將Transformer中的前饋網路替換為專家模組

開源特性

  • 2024年4月17日通過Torrent渠道開源,包含基礎版與指令調優版
  • 模型權重可在Hugging Face、Perplexity AI Labs等平台獲取
  • 部署需258GB顯存,支持Ollama+Open WebUI組合部署方案

性能評測

  • 在MMLU基準測試取得77.5分,超過Qwen1.5-72B-Chat模型
  • 多語言處理能力達到英語77.5%、法語表現突出
  • 微軟基於本模型訓練的WizardLM-2 8x22B版本在MT-Bench評分超過早期GPT-4

套用場景

  • 支持函式調用功能,配合la Plateforme平台實現受限輸出模式
  • 2024年6月高考評測顯示,英語作文生成存在超字數扣分現象
  • 支持大型文檔信息提取,適用於金融分析、代碼生成等專業領域

行業影響

  • 成為Llama 3、Phi-3等同期模型的技術對標對象
  • 微軟將其納入Azure AI平台服務體系,驗證商用可行性
  • 開發者社區評價其為"開源LLM領域新標桿",推動MoE架構普及

相關詞條

熱門詞條

聯絡我們