VibeThinker-1.5B

VibeThinker-1.5B是一個擁有15億參數的大型語言模型(LLM)。該模型是基於阿里巴巴的 Qwen2.5-Math-1.5B 進行的精細調整,現已在 Hugging Face、GitHub 和 ModelScope 上免費提供,供研究人員和企業開發者使用,甚至可用於商業目的,遵循 MIT 許可證。該模型還與 Mistral AI 的 Magistral Medium、Anthropic 的 Claude Opus4和 OpenAI 的 gpt-oss-20B Medium 等多個大型模型抗衡,同時所需的基礎設施和投資成本卻少得多。

2025年11月18日,微博正式發布首個自研開源大模型Vibe Thinker。

基本介紹

  • 中文名:VibeThinker-1.5B
  • 推出單位:微博的人工智慧部門
  • 發布時間:2025年11月18日
發布歷程,模型簡介,

發布歷程

2025年11月13日,中國社交媒體公司微博的人工智慧部門推出了開源的 VibeThinker-1.5B。作為微博AI對“小模型高智商”命題的驗證案例,該模型通過發散探索與強化學習結合的SSP訓練框架,挑戰了傳統大模型依賴參數規模的研發路徑。VibeThinker-1.5B基於阿里巴巴的 Qwen2.5-Math-1.5B 進行精細調整,現已在GitHub、Hugging Face、ModelScope和Arxiv平台開源。該模型通過SSP訓練方法在AIME24、AIME25、HMMT25數學測試集及LiveCodeBench v6編程測試中表現超越或接近參數量超其數十至數百倍的模型,單次後訓練成本低於8000美元。
2025年11月18日,微博正式發布首個自研開源大模型Vibe Thinker。據悉,VibeThinker單次“後訓練”的成本僅7800美元,對比DeepSeek-R1和MiniMax-M1等成本直接降低了幾十倍。

模型簡介

VibeThinker-1.5B是一個擁有15億參數的大型語言模型(LLM),該模型是基於阿里巴巴的 Qwen2.5-Math-1.5B 進行的精細調整,由微博AI研發,現已在Hugging Face、GitHub和ModelScope上免費提供,供研究人員和企業開發者使用,甚至可用於商業目的,遵循MIT許可證。該模型還與Mistral AI的Magistral Medium、Anthropic的Claude Opus4和OpenAI的gpt-oss-20B Medium等多個大型模型抗衡,同時所需的基礎設施和投資成本卻少得多。
VibeThinker-1.5B在後期訓練中僅花費了7800美元的計算資源,這一成本遠低於同類或更大規模模型所需的數十萬美元甚至數百萬美元。例如,DeepSeek-R1和MiniMax-M1的後訓練成本分別達到29萬美元和53萬美元,而本模型成本不足其5%。LLM的訓練分為兩個階段,首先是預訓練,模型通過大量文本數據學習語言結構和一般知識。之後的後期訓練則使用更小的高質量數據集,使模型能夠更好地理解如何提供幫助、進行推理和與人類期望對齊。
VibeThinker-1.5B採用了一種名為“譜-信號原則”(Spectrum-to-Signal Principle,SSP)的訓練框架,該框架將監督微調和強化學習分為兩個階段。第一階段通過鼓勵模型發散探索所有可能的解題路徑實現多樣性,第二階段利用強化學習進行策略最佳化精準鎖定最優推理路徑。在AIME24/25、HMMT25數學測試集及LiveCodeBench v6編程測試中,其表現超越參數量超400倍的DeepSeek-R1等模型,並與456B參數的MiniMax-M1接近。其開放原始碼的發布,打破了對模型參數規模和計算強度的傳統看法,展示了小型模型在特定任務中也能取得優異表現的可能性。此舉顯著降低大模型研發門檻,使中型機構甚至個人研究者能夠參與前沿模型訓練。

相關詞條

熱門詞條

聯絡我們