RLVR

RLVR(可驗證獎勵的強化學習)是通過自動驗證獎勵最佳化模型推理能力的技術。該技術在大語言模型中被廣泛套用於提升數學、編程、視覺推理等任務的表現。

其核心機制通過構建確定性獎勵函式實現模型性能最佳化,與監督微調(SFT)存在最佳化機制的本質差異。RLVR通過受模型結構約束的最佳化偏向,能夠在維持原始權重譜幾何結構的前提下實現性能提升,該技術通過更新集中於模型相同區域形成條紋模式。RLVR的具體訓練機制為:在推理訓練中,只對模型最終是否完成目標給反饋(如數學問題解的唯一正確性、代碼是否通過測試),系統依據預設規則自動判斷結果,模型在嘗試中基於驗證調整推理策略。

正是因為RLVR的存在,導致AI的智力參差不齊,可以在專業領域表現出色,但現實世界犯低級錯誤。2025年訓練大模型的三種辦法是:預訓練、監督微調、人類反饋強化學習,該年度多了關鍵的第四步「可驗證獎勵的強化學習(RLVR)」,這帶來算力分配方式的變化,更多算力用於RLVR階段。至2026年,RLVR技術進一步發展,該年度RLVR技術進展顯著。2026年,RLVR技術被套用於GLM-4.7模型。同時,RLVR技術面臨的挑戰在於將其在數學、編程等可驗證場景的有效能力,擴展到半自動驗證甚至不可驗證的廣闊現實領域。在訓練範式上,Scaling在2026年仍將繼續,但重點正在發生變化。

基本介紹

  • 外文名:RLVR
  • 定義:通過自動驗證獎勵最佳化模型推理能力的技術
主要功能,釋義,

主要功能

在2025年,RLVR已成為大語言模型訓練方法的關鍵步驟,作為預訓練、監督微調、人類反饋強化學習之後的第四步引入。
RLVR在大語言模型中被廣泛套用於提升數學、編程、視覺推理等任務的表現。在2026年AGI-Next前沿峰會上,智譜AI的唐傑教授介紹了RLVR在其最新模型GLM-4.7中的套用。
RLVR帶來算力分配方式的變化,更多算力被用於RLVR階段。此外,RLVR導致AI智力參差不齊,在專業領域(如數學、編程)表現出色,但現實世界犯低級錯誤。
與監督微調(SFT)不同,RLVR通過受模型結構約束的最佳化偏向,能夠在維持原始權重譜幾何結構的前提下實現性能提升。
唐傑教授同時指出,RLVR技術未來的挑戰在於如何將這種在數學、編程等“可驗證”場景下有效的能力,擴展到“半自動驗證”甚至“不可驗證”的廣闊現實領域。

釋義

RLVR(可驗證獎勵的強化學習)是通過自動驗證獎勵最佳化模型推理能力的技術。其工作原理是系統依據預設規則(如數學解的唯一正確性或代碼測試通過)自動判斷模型輸出結果,僅在驗證成功時給予獎勵,從而調整模型的推理策略。在2026年AGI-Next前沿峰會上,智譜AI介紹了RLVR在其最新模型GLM-4.7中的套用,同時指出該技術未來的挑戰在於如何將“可驗證”場景下的能力擴展到“半自動驗證”甚至“不可驗證”的廣闊現實領域。

相關詞條

熱門詞條

聯絡我們