MMLU

MMLU(Massive Multitask Language Understanding)是由加州大學伯克利分校研究人員於2020年9月推出的大模型測評基準,包含初等數學、計算機科學、法律、歷史等57項學科任務,旨在評估大模型的跨領域知識覆蓋和複雜問題解決能力。該基準通過統一提示詞設計和標準化情境學習示例的HELM框架,解決了傳統測評結果不一致的問題。截至2025年,其改進版本MMLU-Pro通過增加複雜題目提升了評估上限,並被史丹福大學等機構用於評估阿里通義Qwen2等領先模型的性能表現。

基本介紹

  • 推出時間:2020年9月 
  • 任務數量:57項 
  • 開發機構:加州大學伯克利分校 
  • 測試語言:英文 
  • 最新版本:MMLU-Pro(2024年) 
  • 套用案例:評估阿里Qwen2-72B等開源模型性能 
基準構成,技術特徵,行業套用,演進趨勢,權威認可,

基準構成

涵蓋基礎數學、美國歷史、計算機科學、法律等57項學科任務,涉及人文、社會科學、自然科學三大知識領域。任務設計包含零樣本和少樣本測試場景,驗證模型在未接觸數據情況下的推理能力。2024年發布的增強版MMLU-Pro通過篩選冗餘題目和增加複雜推理問題,將平均錯誤率較原版提升23%。

技術特徵

採用英語作為統一測試語言,要求模型具備跨學科知識遷移能力。基準包含選擇題和開放式問答兩種題型,其中選擇題占比85%以上,重點考察知識記憶與基礎推理。測評結果反映模型在數學推理(準確率61.8%)、法律分析(58.2%)、歷史事件理解(63.4%)等領域的表現差異。

行業套用

作為大模型能力評估的核心工具,2023年阿里雲Qwen-7B模型在MMLU測試中超越同參數規模競品,2024年Qwen2-72B模型以86.8%準確率登頂開源模型榜首。史丹福大學HELM框架將其納入標準化測評體系,Meta的Llama3-70B、DeepSeek-R1等模型均通過該基準驗證性能。

演進趨勢

2019-2024年間參測模型平均準確率提升64.4%,但存在題目噪聲與文化偏差問題。隨著基準趨於飽和,社區開始研發HLE、FrontierMath等新評測體系。MMLU-Pro通過增加代碼理解、多步驟邏輯題等新題型,將最高得分上限提升至89.3%。

權威認可

斯坦福《2025人工智慧指數報告》將其列為語言理解評估的核心指標,CRFM主任Percy Liang在學術報告中引用其作為模型對比的關鍵依據。截止2024年12月,全球超過76%的大模型研究論文使用該基準進行能力驗證。

相關詞條

熱門詞條

聯絡我們