核心改進方向
情感智慧型
儘管Grok4.1延續了情感智慧型的最佳化方向,但其核心敘事已從聊天體驗轉向能夠執行任務的智慧型體(Agent),強化推理、多模態理解和工具調用能力。Grok4.1此次更新的重要方向之一是增強情感智慧型,與此前OpenAI發布的
GPT-5.1疊代方向一致,均致力於提供更“富有人情味”的互動體驗。官方表示,新模型能更敏銳地感知用戶意圖,更易於溝通,同時保持一致的個性,並延續了前代產品的智慧型與可靠性。為評估進展,
xAI在EQ-Bench3測試中對Grok4.1進行了評測,結果顯示其推理模式與非推理模式均位居榜單前兩名。EQ-Bench是由大語言模型評判的測試,用於評估主動情緒智慧型,包括情緒理解、洞察力、同理心及人際交往技能。
官方舉例稱,當用戶表達“想念我的貓,心都碎了”時,Grok4.1的回應比前代更豐富細緻,具有更真實的同理心,且文筆更出色。
創意寫作能力
在創意寫作方面,Grok4.1展示出顯著提升。例如,當要求其以Grok的視角撰寫一篇關於“突然發現自己擁有意識”的社交媒體帖子時,新版本相比前代呈現出更強的文學表達與戲劇張力。
降低幻覺率
Grok4.1在事實準確性方面也有明顯改進,其信息檢索提示中的事實性幻覺率從12.09%下降至4.22%,減少近三倍。官方表示,這一提升得益於在後訓練階段專注於減少幻覺現象。
工具調用與任務執行能力
根據2025年11月中旬
xAI的發布信息,Grok 4.1重點強化了工具調用能力,其核心定位從聊天體驗轉向"能夠執行任務的Agent"。該版本新增了對多模態輸入的系統級回響機制,支持
API集成與跨平台操作指令解析,使模型具備執行預定工作流和複雜任務序列的能力。
Grok 4.1支持動態環境下的多工具鏈式調用,包含許可權驗證、異常回滾及執行反饋閉環機制。結合
DeepSeek-Math-V2的定理證明能力,該模型可自動完成數學定理證明與驗證,並基於驗證結果執行後續操作流程。
性能表現
在文本能力排行榜上,Grok4.1的深度思考版本(Grok4.1Thinking)以1483的Elo分數位居榜首,非推理模式則以1465分排名第二。此前,xAI對Grok4.1進行了為期兩周的靜默發布,並通過實際流量進行持續盲測和對比測試。與舊版線上生產模型相比,Grok4.1在對比評估中被用戶偏好的機率達到64.78%。
技術最佳化
為實現這些提升,xAI沿用了Grok4的大規模強化學習基礎設施,並將其套用於最佳化模型的風格、個性、實用性與一致性。此外,為有效最佳化那些難以直接驗證的獎勵信號,xAI開發了新方法,利用前沿的智慧型推理模型作為獎勵模型,從而實現大規模自主評估與疊代輸出結果。