發展歷史
其前身
Chatbot Arena於2023年5月正式推出。2025年1月,Chatbot Arena註冊為商業化實體LMArena,由Anastasios N. Angelopoulos任執行長、Wei‑Lin Chiang任首席技術官,
Ion Stoica是聯合創始人兼顧問。
2025年5月,LMArena完成種子輪融資1億美元,由Andreessen Horowitz(a16z)和UC Investments領投。
2025年9月,阿里萬相2.5的圖生視頻在LMArena評測中排名國內首位。
2025年10月5日,國際大模型競技場LMArena的文生圖榜單顯示,騰訊混元圖像3.0在全球26個大模型中排名第一,該結果基於全球用戶的匿名測試。
2025年11月8日,LMArena大模型競技場排名顯示,文心大模型5.0 Preview(ERNIE-5.0-Preview-1022)在文本任務評測中位列全球並列第二、中國第一,在創意寫作、複雜問題理解等任務中得分較高。
2025年11月18日,x.ai發布的
Grok 4.1在LMArena文本能力榜單中,“quasarflux”版本(1483 Elo分)和快速回響版本(1465 Elo分)分列第一、第二名,其排名高於前代Grok 4的第三十三名。
2025年11月18日,在
矽谷Cerebral Valley Summit峰會上,300餘名AI領域創始人及投資者在提及LMArena時預測,
OpenAI在2026年該評測系統的排行榜中可能繼續保持前列。
LMArena榜單的影響力也體現在對新興AI公司的覆蓋上,根據同期峰會匿名調查,
Cursor、
Figure、
Harvey、Mercor、Mistral和Thinking Machines等創業公司均曾進入該評測系統的細分領域排名。
2025年11月25日,百度文心大模型5.0 Preview(ERNIE-5.0-Preview-1022)在LMArena競技場評測中,於文本能力榜單取得全球並列第二、國內第一的成績,在視覺理解榜單排名國內第一。該評測基於11月13日發布的參數量為2.4萬億的
全模態大模型文心5.0,該模型採用原生全模態統一建模技術。
2026年1月6日,百度文心5.0 Preview在LMArena大模型文本榜中排名國內首位。
2026年1月15日,百度文心大模型ERNIE-5.0-0110以1460分登上LMArena文本榜,排名國內第一、全球第八。
2026年1月22日,百度發布文心5.0正式版,該模型在多項權威基準評測中表現領先。
2026年1月,LMArena完成A輪融資1.5億美元,由Felicis Ventures和UC Investments聯合領投,a16z等機構參與,投後估值達到17億美元。該公司在短短一年內完成了種子輪(2025年5月)和A輪兩輪融資。
核心團隊
LMArena的核心團隊由執行長Anastasios N. Angelopoulos、首席技術官Wei‑Lin Chiang和聯合創始人兼顧問
Ion Stoica組成。
Anastasios N. Angelopoulos對於可信賴的人工智慧系統、黑箱決策和醫療機器學習方面的研究頗深,曾在谷歌DeepMind擔任學生研究員。
平台簡介
LMArena是美國
加州大學伯克利分校推出的一個AI模型評估平台,通過盲測機制採集用戶對AI模型回答的匿名投票,形成動態更新的競技場榜單。該平台源自一個開源項目,於2025年5月註冊為商業化實體。其網站向所有用戶開放,訪客提出任務後,平台會調用兩個不同的AI模型生成結果,由用戶在不知模型身份的情況下投票選擇更優者。平台採用雙盲測試和類似西洋棋的Elo評分系統進行動態排名。LMArena匯總所有評分,形成涵蓋
代碼生成、
圖像生成、視頻生成等多個類別的模型排行榜。
其核心評估方法是基於人類真實偏好的盲測機制,強調用戶在實際互動場景中的感受。例如,在2025年11月的評測中,谷歌Gemini 3 Pro以1501的Elo得分創下該平台歷史最高紀錄。隨著AI模型性能差距縮小,許多開發商將LMArena排名作為參考。然而,部分開發商質疑其依賴無償用戶反饋的模式易被操縱且缺乏專家意見。LMArena回應稱,普通用戶對自身相關問題的答案判斷更精準,且不支付報酬的模式能獲得更客觀的反饋。平台已完成多輪融資,所籌資金將用於技術發展。公司計畫利用平台積累的數據,通過強化學習技術訓練AI模型,以拓展業務。