RLVR(可驗證獎勵的強化學習)是通過自動驗證獎勵最佳化模型推理能力的技術。該技術在大語言模型中被廣泛套用於提升數學、編程、視覺推理等任務的表現。
其核心機制通過構建確定性獎勵函式實現模型性能最佳化,與監督微調(SFT)存在最佳化機制的本質差異。RLVR通過受模型結構約束的最佳化偏向,能夠在維持原始權重譜幾何結構的前提下實現性能提升,該技術通過更新集中於模型相同區域形成條紋模式。RLVR的具體訓練機制為:在推理訓練中,只對模型最終是否完成目標給反饋(如數學問題解的唯一正確性、代碼是否通過測試),系統依據預設規則自動判斷結果,模型在嘗試中基於驗證調整推理策略。
正是因為RLVR的存在,導致AI的智力參差不齊,可以在專業領域表現出色,但現實世界犯低級錯誤。2025年訓練大模型的三種辦法是:預訓練、監督微調、人類反饋強化學習,該年度多了關鍵的第四步「可驗證獎勵的強化學習(RLVR)」,這帶來算力分配方式的變化,更多算力用於RLVR階段。至2026年,RLVR技術進一步發展,該年度RLVR技術進展顯著。2026年,RLVR技術被套用於GLM-4.7模型。同時,RLVR技術面臨的挑戰在於將其在數學、編程等可驗證場景的有效能力,擴展到半自動驗證甚至不可驗證的廣闊現實領域。在訓練範式上,Scaling在2026年仍將繼續,但重點正在發生變化。
基本介紹
- 外文名:RLVR
- 定義:通過自動驗證獎勵最佳化模型推理能力的技術
