Chatbot Arena

Chatbot Arena是由國際開放研究組織LMSYS Org推出的大模型競技評測平台,採用匿名盲測機制隨機配對模型,通過用戶投票結合Elo評分系統量化模型能力。該平台由加州大學伯克利分校、聖地亞哥分校和卡內基梅隆大學研究人員聯合開發,支持多輪對話與針對性榜單評測。截至2024年5月,累計收錄44款模型,獲得超過1170萬用戶投票,成為OpenAI、Google等國際廠商認可的大模型評估金標準。

基本介紹

  • 推出機構:LMSYS Org 
  • 上線時間:2023年6月 
  • 評測機制:盲測Elo評分  
  • 參與模型:44款(截至2024.05) 
  • 最新榜首:GPT-4o(2024.05) 
  • 累計投票:超1170萬次 
背景與創立,評測機制,模型參與情況,行業影響,技術延伸,

背景與創立

Chatbot Arena由LMSYS Org於2023年6月正式推出,該組織由加州大學伯克利分校、聖地亞哥分校和卡內基梅隆大學的研究人員聯合組建,旨在通過開放研究推動大型語言模型技術進步。平台上線首周即獲得超過4700次匿名投票,展現出行業關注度。

評測機制

系統採用雙盲測試機制,用戶輸入提示詞後隨機匹配兩個匿名模型生成回答,投票選擇更優回答後才會顯示模型名稱。評測過程引入西洋棋Elo評分系統,通過勝負關係動態調整模型排名。2024年新增重複查詢剔除機制,通過清理冗餘數據提升榜單準確性。

模型參與情況

截至2024年5月,平台收錄44款大模型,包含OpenAI的GPT-4o、零一萬物的Yi-Large等閉源模型,以及Llama3-70B等開源模型。GPT-4o以1287分位居總榜首位,Yi-Large作為前十名中唯一的中國模型位列第七,其中文能力與GPT-4o並列分榜第一。阿里巴巴Qwen-Max、智譜AI GLM-4分別排名第12和15位。

行業影響

Chatbot Arena被OpenAI、Google等公司高管多次引用評測結果,成為行業公認的模型能力評估基準。其匿名對戰機制促使廠商專注模型性能最佳化,例如GPT-4o在內部測試中以約50 Elo分的優勢超越Claude 3 Opus和GPT-4 Turbo。平台公開所有用戶投票數據及評估代碼,支持第三方驗證與算法改良。

技術延伸

平台衍生出編程能力、長提問回響等專項榜單,Yi-Large在艱難提示詞榜單中表現突出。2024年中文分榜數據顯示,其評測體系被中國Compass Arena借鑑,形成中英文評測互補生態。分散式系統架構支持日均數萬次並發評測請求,保障平台穩定運行。

熱門詞條

聯絡我們