LMArena

LMArena

LMArena是由美國加州大學伯克利分校推出的AI模型評估平台,其前身Chatbot Arena於2023年5月正式推出。2025年1月,Chatbot Arena註冊為商業化實體LMArena,由Anastasios N. Angelopoulos任執行長、Wei‑Lin Chiang任首席技術官,Ion Stoica是聯合創始人兼顧問。該平台採用匿名雙盲測試機制採集用戶對AI模型生成結果的偏好投票,形成動態更新的競技場榜單,託管超過400個AI模型,累計獲得超350萬張用戶投票,在全球150個國家和地區擁有超500萬月活躍用戶。2025年5月,平台完成1億美元種子輪融資,由Andreessen Horowitz(a16z)和UC Investments領投,並於2025年5月正式轉型為營利性企業,新增WebDev Arena等模組。2025年,平台發布了多項AI模型能力的評測榜單,涵蓋文本、圖像、視頻等多個類別。2025年10月,騰訊混元圖像3.0在LMArena的文生圖榜單中排名第一。2025年11月,谷歌Gemini 3 Pro以1501 Elo得分創下該平台歷史最高紀錄,同期x.ai發布的Grok 4.1在文本能力榜單中分列第一、第二名,百度文心大模型5.0 Preview則在文本能力榜單取得全球並列第二、國內第一的成績。2025年12月,Gemini 3 Flash在LMArena文本能力排名中升至第三位,文心新模型ERNIE-5.0-Preview-1203以1451分位列文本榜中國第一。2026年1月,LMArena在新一輪融資中籌集到1.5億美元資金,由Felicis Ventures和UC Investments聯合領投,投後估值達到17億美元。同月,百度文心大模型ERNIE-5.0-0110以1460分登上LMArena文本榜,排名國內第一、全球第八,並在數學能力排名中位列全球第二。

基本介紹

  • 外文名:LMArena
  • 類型:AI模型評估平台
  • 創建人:Ion Stoica與Wei-Lin Chiang等人
  • 發布時間:2025年
發展歷史,核心團隊,平台簡介,

發展歷史

其前身Chatbot Arena於2023年5月正式推出。2025年1月,Chatbot Arena註冊為商業化實體LMArena,由Anastasios N. Angelopoulos任執行長、Wei‑Lin Chiang任首席技術官,Ion Stoica是聯合創始人兼顧問。
2025年5月,LMArena完成種子輪融資1億美元,由Andreessen Horowitz(a16z)和UC Investments領投。
2025年9月,阿里萬相2.5的圖生視頻在LMArena評測中排名國內首位。
2025年10月5日,國際大模型競技場LMArena的文生圖榜單顯示,騰訊混元圖像3.0在全球26個大模型中排名第一,該結果基於全球用戶的匿名測試。
2025年11月8日,LMArena大模型競技場排名顯示,文心大模型5.0 Preview(ERNIE-5.0-Preview-1022)在文本任務評測中位列全球並列第二、中國第一,在創意寫作、複雜問題理解等任務中得分較高。
2025年11月18日,x.ai發布的Grok 4.1在LMArena文本能力榜單中,“quasarflux”版本(1483 Elo分)和快速回響版本(1465 Elo分)分列第一、第二名,其排名高於前代Grok 4的第三十三名。
2025年11月18日,在矽谷Cerebral Valley Summit峰會上,300餘名AI領域創始人及投資者在提及LMArena時預測,OpenAI在2026年該評測系統的排行榜中可能繼續保持前列。
LMArena榜單的影響力也體現在對新興AI公司的覆蓋上,根據同期峰會匿名調查,Cursor、Figure、Harvey、Mercor、Mistral和Thinking Machines等創業公司均曾進入該評測系統的細分領域排名。
2025年11月25日,百度文心大模型5.0 Preview(ERNIE-5.0-Preview-1022)在LMArena競技場評測中,於文本能力榜單取得全球並列第二、國內第一的成績,在視覺理解榜單排名國內第一。該評測基於11月13日發布的參數量為2.4萬億的全模態大模型文心5.0,該模型採用原生全模態統一建模技術。
2025年12月18日,Gemini 3 Flash在LMArena文本能力排名中升至第三位。
2025年12月23日,LMArena大模型競技場發布排名,文心新模型ERNIE-5.0-Preview-1203以1451分位列文本榜中國第一,在創意寫作、高難度指令等任務中得分較高,其排名超過Claude-Opus-4-1、GPT-5.2、GPT-5.1、和Qwen3-Max-Preview等多款國內外主流模型。
2026年1月6日,百度文心5.0 Preview在LMArena大模型文本榜中排名國內首位。
2026年1月15日,百度文心大模型ERNIE-5.0-0110以1460分登上LMArena文本榜,排名國內第一、全球第八。
2026年1月22日,百度發布文心5.0正式版,該模型在多項權威基準評測中表現領先。
2026年1月,LMArena完成A輪融資1.5億美元,由Felicis Ventures和UC Investments聯合領投,a16z等機構參與,投後估值達到17億美元。該公司在短短一年內完成了種子輪(2025年5月)和A輪兩輪融資。

核心團隊

LMArena的核心團隊由執行長Anastasios N. Angelopoulos、首席技術官Wei‑Lin Chiang和聯合創始人兼顧問Ion Stoica組成。
Anastasios N. Angelopoulos對於可信賴的人工智慧系統、黑箱決策和醫療機器學習方面的研究頗深,曾在谷歌DeepMind擔任學生研究員。
Wei‑Lin Chiang在Stoica領導的天空計算實驗室研究分散式系統和深度學習框架,此前曾在谷歌研究、亞馬遜和微軟從事研究工作。
Ion Stoica是UC伯克利大學的計算機系教授,同時領導著該校的天空計算實驗室,還是位連續創業者,先後參與創辦了Anyscale、Databricks、Conviva Networks等公司。

平台簡介

LMArena是美國加州大學伯克利分校推出的一個AI模型評估平台,通過盲測機制採集用戶對AI模型回答的匿名投票,形成動態更新的競技場榜單。該平台源自一個開源項目,於2025年5月註冊為商業化實體。其網站向所有用戶開放,訪客提出任務後,平台會調用兩個不同的AI模型生成結果,由用戶在不知模型身份的情況下投票選擇更優者。平台採用雙盲測試和類似西洋棋的Elo評分系統進行動態排名。LMArena匯總所有評分,形成涵蓋代碼生成、圖像生成、視頻生成等多個類別的模型排行榜。
其核心評估方法是基於人類真實偏好的盲測機制,強調用戶在實際互動場景中的感受。例如,在2025年11月的評測中,谷歌Gemini 3 Pro以1501的Elo得分創下該平台歷史最高紀錄。隨著AI模型性能差距縮小,許多開發商將LMArena排名作為參考。然而,部分開發商質疑其依賴無償用戶反饋的模式易被操縱且缺乏專家意見。LMArena回應稱,普通用戶對自身相關問題的答案判斷更精準,且不支付報酬的模式能獲得更客觀的反饋。平台已完成多輪融資,所籌資金將用於技術發展。公司計畫利用平台積累的數據,通過強化學習技術訓練AI模型,以拓展業務。

熱門詞條

聯絡我們