Baichuan2-13B

Baichuan2-13B是由百川智慧型於2023年9月推出的開源大語言模型,採用130億參數規模,基於PyTorch 2.0框架開發,訓練過程消耗2.6萬億tokens高質量多語言數據。該模型在數學能力、代碼能力、安全能力等五大核心維度較前代提升15%-49%,支持英語和中文文本生成,適配多語言翻譯任務。作為國內首個全程開源訓練過程的大模型,其遵循Apache 2.0協定並提供免費商用許可,在MMLU、CMMLU等權威評測中超越同規模國際主流模型。

基本介紹

  • 開發者:百川智慧型
  • 參數規模:130億
  • 訓練數據:2.6萬億tokens
  • 多語言支持:中英雙語
  • 開源協定:Apache 2.0
  • 發布時間:2023年9月
技術特性,評測表現,開源與商用,開發支持,版本疊代,

技術特性

  • 架構設計:基於PyTorch 2.0框架構建,利用F.scaled_dot_product_attention加速推理,包含Base基礎模型和Chat對話最佳化版本
  • 訓練數據:採用2.6萬億tokens高質量語料,覆蓋學術論文、專業書籍、多語言網頁等類型,中文數據占比超過30%
  • 能力提升:相較前代模型實現數學能力提升49%、代碼能力提升46%、安全能力提升37%、邏輯推理能力提升25%、語義理解能力提升15%
  • 長文本處理:集成192K長視窗處理技術,支持複雜文檔分析和多輪對話場景

評測表現

在2023年9月發布的評測報告中:
  • 中文權威基準CMMLU測試中取得61.97分(5-shot),超過LLaMA2-13B的48.5分
  • 醫學問答測試MedQA獲得59.17分,較同規模主流模型提升超20%
  • 通用語言理解測試MMLU得分58.10,達到商用閉源模型水平
  • 代碼生成任務HumanEval評測中,以70億參數規模實現與130億參數LLaMA2相當的性能

開源與商用

  • 授權模式:遵循Apache 2.0開源協定,開發者滿足日活用戶(DAU)低於100萬、不從事雲服務等限定條件時,可通過郵件申請免費商用許可
  • 技術披露:開源訓練過程中從0.2萬億至2.4萬億tokens階段的22個檢查點,為學界研究大模型訓練動態提供完整數據
  • 社區生態:在HuggingFace和ModelScope平台累計下載量突破500萬次,與騰訊雲、阿里雲等企業建立深度合作

開發支持

  • 部署工具:提供配套Notebook工具鏈,支持模型量化、微調及服務部署
  • API服務:集成搜尋增強功能,可自動調用搜尋引擎獲取實時信息
  • 知識庫支持:開放限時免費的線上對話平台及知識庫功能

版本疊代

  • 量化版本:發布4bit量化模型,顯存占用降低至原版的25%,保持95%以上原始性能
  • 技術延續:作為Baichuan開源系列的第三代產品,與前期發布的7B/13B模型形成完整技術矩陣
  • 行業套用:衍生版本鵬城-百川·腦海33B已套用於金融文檔分析和法律契約審核場景
模型通過北京市科學技術委員會組織的技術審查,於2023年8月31日通過《生成式人工智慧服務管理暫行辦法》備案,成為首批合規商用的大模型產品。

相關詞條

熱門詞條

聯絡我們