Step3-VL-10B

Step3-VL-10B,系2026年1月20日開源的多模態模型。Step3-VL-10B在視覺感知、邏輯推理、數學競賽以及通用對話等一系列基準測試中均達到同規模SOTA水平。

基本介紹

  • 外文名:Step3-VL-10B
  • 開源日期:2026年1月20日
簡介,發展歷史,核心亮點,獨特設計,

簡介

Step3-VL-10B,僅用10B參數量,Step3-VL-10B在視覺感知、邏輯推理、數學競賽以及通用對話等一系列基準測試中均達到同規模SOTA水平,並且解決了參數量小和智慧型水平高難以兼優的行業難題。
Step3-VL-10B提供SeRe(順序推理)和PaCoRe(並行協調推理)兩種範式,在STEM推理、識別、OCR&文檔、GUI Grounding、空間理解、代碼等核心維度,都取得了千億級別模型的優秀分數,PaCoRe範式表現更優。

發展歷史

2026年1月20日,階躍星辰宣布多模態模型Step3-VL-10B開源。

核心亮點

Step3-VL-10B 具備三大核心亮點:
  • 極致視覺感知標桿:在同參數量級中展現出頂尖的識別與感知精度。通過引入PaCoRe(並行協調推理) 機制,模型在複雜計數、高精度OCR及空間拓撲理解等高難度任務上的可靠性實現了質的飛躍。
  • 深層邏輯推演與長程推理:得益於規模化強化學習(RL)的持續疊代,Step3-VL-10B在10B規模上實現了跨任務推理能力的階躍。無論是競賽級數學難題、真實編程環境還是視覺邏輯謎題,模型均能通過嚴密的多步思維鏈推導出最終答案。
  • 強大端側 Agent 互動:基於海量GUI(圖形用戶界面)專用預訓練數據,模型能夠精準識別並操作複雜界面,成為端側Agent的核心引擎。

獨特設計

1.全參數端到端多模態聯合預訓練:摒棄了傳統分階段凍結模組的訓練範式,直接在 1.2T 高質量多模態數據集上進行全參數聯合訓練。這種方式實現了視覺特徵與語言邏輯在底層語義空間的深度對齊,為模型構建了極致的感知能力與複雜的跨模態推理基石。
2.大規模多模態強化學習(RL)演進:率先將大規模強化學習引入多模態領域,歷經超過 1,400 次疊代最佳化。模型在視覺識別、數理邏輯推理及通用對話等維度的能力均實現質的飛躍,且實驗數據表明,模型性能仍處於上升通道,尚未觸及飽和邊界。
3.並行協調推理機制(PaCoRe):創新性地引入 PaCoRe 機制,支持推理階段的動態算力擴展。通過並行探索多個感知假設並進行多維證據聚合,該機制顯著提升了模型在競賽級數學、複雜 OCR 識別、精準物體計數及空間拓撲推理中的準確度。

相關詞條

熱門詞條

聯絡我們