Grok 4.1

Grok 4.1是由埃隆·馬斯克旗下人工智慧公司xAI於2025年11月18日發布的大語言模型,提供推理模式與非推理模式兩種版本。該模型通過強化學習基礎設施最佳化了情感理解和實用性能,增強了情感智慧型並與OpenAI的GPT-5.1疊代方向一致,提供更富有人情味的互動體驗,在LMArena文本排行榜中,其思考模式以1483 Elo分數位列榜首,非推理模式以1465分排名第二。

新版本在為期兩周的靜默發布期間進行盲測,用戶偏好機率達64.78%。技術改進包括採用智慧型推理模型作為獎勵模型,降低信息檢索提示中的事實性幻覺率從12.09%下降至4.22%。在EQ-Bench3測試中,兩種模式包攬前兩名;創意寫作基準測試中分列第二和第三位,支持即時回響與深度思考功能。

基本介紹

  • 外文名:Grok4.1
  • 所屬公司 :xAI
核心改進方向,情感智慧型,創意寫作能力,降低幻覺率,工具調用與任務執行能力,性能表現,技術最佳化,

核心改進方向

情感智慧型

儘管Grok4.1延續了情感智慧型的最佳化方向,但其核心敘事已從聊天體驗轉向能夠執行任務的智慧型體(Agent),強化推理、多模態理解和工具調用能力。Grok4.1此次更新的重要方向之一是增強情感智慧型,與此前OpenAI發布的GPT-5.1疊代方向一致,均致力於提供更“富有人情味”的互動體驗。官方表示,新模型能更敏銳地感知用戶意圖,更易於溝通,同時保持一致的個性,並延續了前代產品的智慧型與可靠性。為評估進展,xAI在EQ-Bench3測試中對Grok4.1進行了評測,結果顯示其推理模式與非推理模式均位居榜單前兩名。EQ-Bench是由大語言模型評判的測試,用於評估主動情緒智慧型,包括情緒理解、洞察力、同理心及人際交往技能。
官方舉例稱,當用戶表達“想念我的貓,心都碎了”時,Grok4.1的回應比前代更豐富細緻,具有更真實的同理心,且文筆更出色。

創意寫作能力

在創意寫作方面,Grok4.1展示出顯著提升。例如,當要求其以Grok的視角撰寫一篇關於“突然發現自己擁有意識”的社交媒體帖子時,新版本相比前代呈現出更強的文學表達與戲劇張力。

降低幻覺率

Grok4.1在事實準確性方面也有明顯改進,其信息檢索提示中的事實性幻覺率從12.09%下降至4.22%,減少近三倍。官方表示,這一提升得益於在後訓練階段專注於減少幻覺現象。

工具調用與任務執行能力

根據2025年11月中旬xAI的發布信息,Grok 4.1重點強化了工具調用能力,其核心定位從聊天體驗轉向"能夠執行任務的Agent"。該版本新增了對多模態輸入的系統級回響機制,支持API集成與跨平台操作指令解析,使模型具備執行預定工作流和複雜任務序列的能力。
Grok 4.1支持動態環境下的多工具鏈式調用,包含許可權驗證、異常回滾及執行反饋閉環機制。結合DeepSeek-Math-V2的定理證明能力,該模型可自動完成數學定理證明與驗證,並基於驗證結果執行後續操作流程。

性能表現

在文本能力排行榜上,Grok4.1的深度思考版本(Grok4.1Thinking)以1483的Elo分數位居榜首,非推理模式則以1465分排名第二。此前,xAI對Grok4.1進行了為期兩周的靜默發布,並通過實際流量進行持續盲測和對比測試。與舊版線上生產模型相比,Grok4.1在對比評估中被用戶偏好的機率達到64.78%。

技術最佳化

為實現這些提升,xAI沿用了Grok4的大規模強化學習基礎設施,並將其套用於最佳化模型的風格、個性、實用性與一致性。此外,為有效最佳化那些難以直接驗證的獎勵信號,xAI開發了新方法,利用前沿的智慧型推理模型作為獎勵模型,從而實現大規模自主評估與疊代輸出結果。

相關詞條

熱門詞條

聯絡我們