s1(由李飛飛團隊開發的人工智慧推理模型)

本詞條是多義詞,共5個義項
更多義項 ▼ 收起列表 ▲

s1是由史丹福大學和華盛頓大學的研究團隊(包括“AI教母”李飛飛)於2025年2月開發的人工智慧推理模型。該模型基於阿里雲通義千問Qwen2.5-32B-Instruct開源模型訓練,通過監督微調技術僅在16塊英偉達H100 GPU上耗時26分鐘完成訓練,雲計算成本不足50美元。s1在數學和編碼能力測試中表現優異,與OpenAI的O1和DeepSeek的R1等尖端模型相當,在競賽數學問題上甚至超越O1-preview模型27%。

基本介紹

  • 開發團隊:李飛飛團隊
  • 訓練時間:2025年2月
  • 基座模型:Qwen2.5-32B-Instruct
  • 訓練時長:26分鐘
  • 訓練成本:50美元
  • 測試領域:數學、編碼    
開發背景,技術細節,性能表現,創新與影響,

開發背景

2025年2月,李飛飛團隊利用開源大模型生態,以極低成本實現高效訓練。s1的研發旨在探索AI模型訓練平民化路徑,通過整合開源基座模型與知識蒸餾技術,突破資源限制。s1基於阿里雲通義千問Qwen2.5-32B-Instruct開源模型訓練,在16塊H100 GPU上監督微調26分鐘完成,訓練成本僅50美元。該模型在數學和編碼能力測試中的表現與OpenAI的o1和DeepSeek的R1等尖端推理模型相當。

技術細節

  • 基座模型:基於阿里雲通義千問Qwen2.5-32B-Instruct模型監督微調訓練。
  • 訓練方法:採用谷歌Gemini2.0FlashThinkingExperimental提煉的1000個樣本數據集進行微調。
  • 硬體配置:使用16塊英偉達H100 GPU完成26分鐘訓練。
  • 關鍵技術:引入“預算強制”技術控制模型思考時間,增強推理可靠性。

性能表現

在數學和編碼測試中,s1綜合表現與DeepSeek R1、OpenAI O1相當。2025年2月測試數據顯示,s1在競賽數學問題上準確率較O1-preview高出27%。其訓練成本僅為DeepSeek R1的0.0009%(50美元 vs 557.6萬美元)。

創新與影響

s1通過蒸餾法由谷歌推理模型Gemini2.0FlashThinkingExperimental提煉樣本微調基座模型,以極低成本實現高性能。該成果為科研機構及初創公司提供了低資源消耗的AI訓練範式,推動大模型套用平民化。阿里雲方面指出,Qwen開源生態衍生模型已超9萬個,s1的成功印證了開源基座模型的標桿價值。

相關詞條

熱門詞條

聯絡我們