Phi-3-vision是微軟旗下小語言AI模型家族(SLM)推出的首款多模態模型,參數量為42億,支持128k上下文長度,訓練時間為2024年2月至4月,可在移動平台運行。該模型基於Phi-3-mini架構開發,整合文本與圖像理解能力,能解析現實世界圖片並提取文字,特別針對圖表和方塊圖(Block diagram)識別能力進行專項最佳化,適用於辦公場景下的信息推論與戰略建議生成。
模型採用教科書級教育材料、代碼、圖文標註數據、圖表圖片等多類型訓練內容,數據來源可追溯且不含個人信息。性能測試顯示,其在ScienceQA、MathVista等基準測試中表現優異,與Claude 3-haiku、Gemini 1.0 Pro等模型性能相當,並對比Llama3-Llava-Next(8B)、LlaVA-1.6(7B)等競品展現優勢。
Phi-3-vision-128k-Instruct模型已部署至Azure機器學習平台,支持通過Python調用推理API處理文本與圖像混合輸入,並開放ONNX Runtime最佳化部署接口實現跨平台運行。微軟同步開源了模型檔案,在魔搭社區和Hugging Face平台提供完整推理代碼及微調教程。
基本介紹
- 外文名:Phi-3-vision
- 發布企業:微軟
