s1是由史丹福大學和華盛頓大學的研究團隊(包括“AI教母”李飛飛)於2025年2月開發的人工智慧推理模型。該模型基於阿里雲通義千問Qwen2.5-32B-Instruct開源模型訓練,通過監督微調技術僅在16塊英偉達H100 GPU上耗時26分鐘完成訓練,雲計算成本不足50美元。s1在數學和編碼能力測試中表現優異,與OpenAI的O1和DeepSeek的R1等尖端模型相當,在競賽數學問題上甚至超越O1-preview模型27%。
基本介紹
- 開發團隊:李飛飛團隊
- 訓練時間:2025年2月
- 基座模型:Qwen2.5-32B-Instruct
- 訓練時長:26分鐘
- 訓練成本:50美元
- 測試領域:數學、編碼
開發背景
技術細節
- 基座模型:基於阿里雲通義千問Qwen2.5-32B-Instruct模型監督微調訓練。
- 訓練方法:採用谷歌Gemini2.0FlashThinkingExperimental提煉的1000個樣本數據集進行微調。
- 硬體配置:使用16塊英偉達H100 GPU完成26分鐘訓練。
- 關鍵技術:引入“預算強制”技術控制模型思考時間,增強推理可靠性。
