Phi-3-mini

Phi-3-mini是微軟於2024年4月發布的一款輕量級語言AI模型,其3.8B參數版本在基準測試中性能接近GPT-3.5等大型模型,但訓練成本僅為同類模型的十分之一。該模型支持4k和128k tokens的上下文長度,通過合成數據集與篩選網路數據的混合訓練方式實現高效學習,適用於移動端本地部署,可在手機等資源受限設備離線運行。微軟已將其集成至Azure AI、Hugging Face等平台,並在農業諮詢等實際場景中完成落地套用。

基本介紹

  • 發布時間:2024年4月23日 
  • 參數規模:3.8B(38億) 
  • 訓練數據:3.3萬億token 
  • 上下文長度:4k/128k tokens
  • 測試得分:MMLU 69%,MT-bench 8.38 
  • 部署平台:Azure、Hugging Face、Ollama 
技術特點,性能表現,部署與套用,後續版本,技術演進,

技術特點

  • 數據架構:採用合成數據集(AI生成的兒童讀物)與過濾後的網路數據混合訓練,提升參數效率
  • 模型架構:延續Phi系列設計,Phi-3-mini-3.8B基於3.3萬億token訓練,引入tiktoken分詞器增強多語言處理能力
  • 最佳化目標:以較小參數規模實現大模型性能,128k tokens版本為同類首個長上下文視窗模型

性能表現

  • 在語言理解(MMLU)、數學推理(MATH)和編碼能力基準測試中,超越70億參數規模的Mistral-7B、Gemma-7B等模型
  • 多輪對話MT-bench得分8.38,接近GPT-3.5水平(8.39)
  • 回響速度比同規模模型快90%,iPhone 14本地運行可達每秒12個token

部署與套用

  • 部署方式:
  • 通過微軟Azure AI模型目錄、Hugging Face平台及Ollama本地框架提供
  • 針對英偉達GPU進行運行最佳化,支持NIM工具鏈集成
典型場景:
  • 社交媒體帖子生成等輕量級內容創作任務

後續版本

  • Phi-3-mini:38億參數版本,改進分詞器並擴展多語言支持
  • Phi-3-medium:140億參數預覽版,計畫解決數據偏差問題後正式發布
  • Phi-3-vision:2024年5月推出的多模態衍生模型,繼承Phi-3-mini的輕量化特性

技術演進

  • 訓練數據截止2024年4月,與前代Phi-2(38億參數)相比,MMLU得分提升23個百分點
  • 通過指令微調(Phi-3-mini-instruct)顯著提升對話互動能力
  • 微軟官方聲明其成本優勢源於數據質量而非參數規模,實現數量級差異的成本控制

相關詞條

熱門詞條

聯絡我們