MMLU(Massive Multitask Language Understanding)是由加州大學伯克利分校研究人員於2020年9月推出的大模型測評基準,包含初等數學、計算機科學、法律、歷史等57項學科任務,旨在評估大模型的跨領域知識覆蓋和複雜問題解決能力。該基準通過統一提示詞設計和標準化情境學習示例的HELM框架,解決了傳統測評結果不一致的問題。截至2025年,其改進版本MMLU-Pro通過增加複雜題目提升了評估上限,並被史丹福大學等機構用於評估阿里通義Qwen2等領先模型的性能表現。
基本介紹
- 推出時間:2020年9月
- 任務數量:57項
- 開發機構:加州大學伯克利分校
- 測試語言:英文
- 最新版本:MMLU-Pro(2024年)
- 套用案例:評估阿里Qwen2-72B等開源模型性能
