OpenELM是蘋果公司於2024年4月發布的開源大語言模型系列,包含2.7億、4.5億、11億和30億四種參數規模的預訓練及指令微調版本。該模型採用分層縮放策略最佳化Transformer架構,通過非均勻參數分配提升計算效率,在公開數據集上的性能超越同類規模開源模型。蘋果首次完整公開了包含訓練日誌、檢查點和配置檔案的開發框架,並適配蘋果設備端側推理能力。
基本介紹
- 開發者:蘋果公司
- 發布時間:2024年4月25日
- 參數版本:2.7/4.5/11/30億
- 技術架構:分層Transformer
- 開源內容:代碼/權重/訓練框架
- 運行平台:蘋果設備端側
技術架構,模型規格,開源內容,端側部署,性能表現,開發意義,
技術架構
採用改進的Transformer架構,通過分層縮放策略實現參數最佳化分配,在注意力層與前饋層之間非均勻配置參數資源。架構創新包括:
- 分組查詢注意力機制降低記憶體占用
- SwiGLU激活函式提升非線性表達能力
- Flash注意力技術加速運算過程
模型規格
提供兩種形態的模型版本:
- 預訓練基礎模型:包含2.7億至30億參數版本,訓練使用Reddit、維基百科等公開數據構建的1.8萬億token數據集
- 指令調優版本:在基礎模型上追加對話指令最佳化,支持文本生成、代碼生成等任務
開源內容
包含完整的開發框架CoreNet庫:
- 數據整理工具集支持多源數據處理
- 預訓練配置檔案公開超參數設定
- 訓練日誌及檢查點覆蓋全生命周期
- MLX庫轉換代碼支持蘋果晶片部署
端側部署
針對移動設備進行專項最佳化:
- 30億參數模型可在M2 Max晶片的MacBook Pro(macOS14.4.1系統)流暢運行
- 記憶體占用較傳統架構降低50%,預訓練所需tokens量減少50%,適應智慧型手機本地推理需求
- 提供CoreNet深度神經網路庫支持硬體加速
性能表現
在多項基準測試中展現競爭力:
- 11億參數版本準確率較同規模OLMo模型提升2.36%
- 2.7億參數版本在MMLU測試超越部分30億參數模型
- ARC-C基準測試得分42.24%,但在MMLU(26.76%)等測試中落後微軟Phi-3 Mini
開發意義
作為蘋果首個完整開源的大模型項目:
- 打破傳統閉源模式,構建開放研究基礎設施
- 提供可復現的技術方案促進學術研究
- 推動端側AI套用開發

