Phi-3-mini是微軟於2024年4月發布的一款輕量級語言AI模型,其3.8B參數版本在基準測試中性能接近GPT-3.5等大型模型,但訓練成本僅為同類模型的十分之一。該模型支持4k和128k tokens的上下文長度,通過合成數據集與篩選網路數據的混合訓練方式實現高效學習,適用於移動端本地部署,可在手機等資源受限設備離線運行。微軟已將其集成至Azure AI、Hugging Face等平台,並在農業諮詢等實際場景中完成落地套用。
基本介紹
- 發布時間:2024年4月23日
- 參數規模:3.8B(38億)
- 訓練數據:3.3萬億token
- 上下文長度:4k/128k tokens
- 測試得分:MMLU 69%,MT-bench 8.38
- 部署平台:Azure、Hugging Face、Ollama
技術特點
- 數據架構:採用合成數據集(AI生成的兒童讀物)與過濾後的網路數據混合訓練,提升參數效率
- 模型架構:延續Phi系列設計,Phi-3-mini-3.8B基於3.3萬億token訓練,引入tiktoken分詞器增強多語言處理能力
- 最佳化目標:以較小參數規模實現大模型性能,128k tokens版本為同類首個長上下文視窗模型
性能表現
- 在語言理解(MMLU)、數學推理(MATH)和編碼能力基準測試中,超越70億參數規模的Mistral-7B、Gemma-7B等模型
- 多輪對話MT-bench得分8.38,接近GPT-3.5水平(8.39)
- 回響速度比同規模模型快90%,iPhone 14本地運行可達每秒12個token
部署與套用
- 部署方式:
- 通過微軟Azure AI模型目錄、Hugging Face平台及Ollama本地框架提供
- 針對英偉達GPU進行運行最佳化,支持NIM工具鏈集成
- 社交媒體帖子生成等輕量級內容創作任務
後續版本
- Phi-3-mini:38億參數版本,改進分詞器並擴展多語言支持
- Phi-3-medium:140億參數預覽版,計畫解決數據偏差問題後正式發布
- Phi-3-vision:2024年5月推出的多模態衍生模型,繼承Phi-3-mini的輕量化特性
技術演進
- 訓練數據截止2024年4月,與前代Phi-2(38億參數)相比,MMLU得分提升23個百分點
- 通過指令微調(Phi-3-mini-instruct)顯著提升對話互動能力
- 微軟官方聲明其成本優勢源於數據質量而非參數規模,實現數量級差異的成本控制
