Humanity's Last Exam(HLE,常譯作“人類最後考試”)是一個由人工智慧安全中心(Center for AI Safety)與Scale AI聯合開發的高難度多模態基準測試,旨在評估人工智慧模型在人類知識前沿的學術與推理能力。該基準於2025年確立,題庫最初包含2500道題目,覆蓋數學、自然科學、人文社科等100多個學科領域,題目形式包括選擇題和需精確匹配答案的簡答題,其中部分題目結合了文本與圖像理解。
為構建題庫,項目通過公開徵集並設立總額50萬美元的獎金,吸引了來自全球50多個國家、近千名學者的參與和貢獻。其設計目標是成為衡量AI模型在封閉式學術問題上能力的高標準測試。發布初期,主流前沿模型在此測試上的準確率部分低於10%,但隨後模型性能快速提升,至2025年,已有模型在使用工具的情況下準確率超過40%。
基本介紹
- 中文名:人類最後考試
- 外文名:Humanity's Last Exam
- 別名:HLE
歷史背景,設計與構成,評估方法與表現,技術特點,影響與評價,
歷史背景
2024年9月,非營利組織AI安全中心(Center for AI Safety, CAIS)與數據公司Scale AI宣布合作計畫,並設立總額50萬美元的獎金池,向全球學者徵集高難度問題。該基準測試由Center for AI Safety與Scale AI聯合開發,旨在應對AI發展過快導致的“基準飽和”問題,提供一個位於人類知識前沿的、有足夠挑戰性的評估工具。
2025年1月,基準測試及其首批結果正式公布。初期結果顯示,所有前沿大模型在HLE上的準確率均未超過10%。HLE被設計為“同類中具有廣泛學科覆蓋範圍的封閉式學術基準”,旨在追蹤AI系統距離專家級能力的差距。
設計與構成
HLE(Humanity‘s Last Exam)是一個位於人類知識前沿的多模態基準測試,由Scale AI與Center for AI Safety(CAIS)聯合開發,其設計目標是成為一個具有廣泛學科覆蓋範圍的綜合性封閉式學術基準。
該基準旨在應對“基準飽和”問題,其題庫最終規模包含2500至3000個高難度問題,覆蓋超過100個學科領域,包括數學、自然科學、計算機科學與人工智慧、工程學、人文學科與社會科學等。問題設計為碩士或博士級別以上難度,答案無法通過簡單網際網路搜尋獲得,強調原創性與深度推理。
HLE主要包含兩種適合自動評估的問題格式,一是精確匹配題(Exact-Match Questions),要求模型輸出與標準答案完全一致的特定字元串,此類題目占比約76%-80%;二是多項選擇題(Multiple-Choice Questions),通常有五個或更多選項,此類題目占比約20%-24%。HLE是一個多模態基準,其中約10%至14%的問題需要模型同時理解文本和圖像(如圖表、公式等)才能正確回答。
HLE的題目通過設立總額50萬美元的全球懸賞進行徵集,最終吸引了來自50多個國家、500多家研究機構和企業的近1000名學者提交問題。篩選過程分為多階段:首先由最先進的AI模型進行難度預檢測,隨後通過兩輪人類專家評審,並經過社區反饋與審計,最終確定入選題庫的題目。
為確保評估的可靠性,HLE將數據集分為公開部分和私有的、不對外公布的測試集。其官方排行榜和最終評分主要依據私有測試集進行,以此檢測模型是否存在過擬合。
評估方法與表現
Humanity's Last Exam (HLE) 旨在通過嚴格的自動評分系統評估AI模型。HLE包含兩種主要題型:精確匹配題(要求模型輸出特定字元串)和復選題(通常有5個或更多選項)。HLE是一個多模態基準,其中10%至14%的問題需要結合對文本和圖像的理解才能作答。
該基準在2025年1月首次公布時,對前沿大語言模型構成了嚴峻挑戰。根據當時的測試結果,包括GPT-4o、Claude 3.5 Sonnet、Gemini系列、DeepSeek-R1和o3-mini-high等在內的所有模型,在純文本模式下的準確率均未超過10%。
基準的開發者當時預測,鑒於AI技術的快速發展,到2025年底,模型的準確率就有望超過50%。事實上,這一預測後續被不斷驗證。在2025年內,多個模型通過增強推理能力、引入多智慧型體架構或利用工具,成績得到顯著提升。例如,xAI的Grok-4在2025年7月發布時,基礎版本在HLE上得分為25%,而其重型的多智慧型體版本分數則提升至44%。
性能提升的趨勢在2025年末至2026年初持續。2025年12月,視頻會議軟體Zoom宣稱其AI模型在HLE上取得了48.1%的成績,同期初創公司Sup AI則宣稱其系統準確率達到52.15%。進入2026年,月之暗面(Moonshot AI)發布的Kimi K2 Thinking模型在HLE上達到了45%的準確率。這些成績(不包括官方榜單成績)顯示了AI模型在該高難度基準上的持續進步。
需要指出的是,不同機構宣稱的成績可能基於不同的測試子集(如包含專家審核的HLE Bio/Chem Gold子集或使用工具等不同配置)。為了確保評估的規範性和可比性,Scale AI維護著HLE的官方排行榜,通常記錄單一模型在標準條件下的成績。用戶在參考模型表現時,需注意區分經官方認證的成績與廠商自行宣稱的成績。
技術特點
根據其官方定義,HLE是一個“位於人類知識前沿的多模態基準”,其設計目標是成為“具有廣泛學科覆蓋範圍的終極封閉式學術基準”。為確保問題難度,HLE要求提交的問題需達到“碩士級別以上難度”,並採用了嚴格的篩選流程:首先由最先進的AI進行難度預檢測,無法解答的問題再交由領域專家進行兩輪人工評審。
題庫最終包含約2500至3000道高難度問題,覆蓋超過100個學科。其中數學類題目占比最高,達41%,人文學科與社會科學類題目占比約18%。具體而言,約76%的題目為要求答案字元串完全匹配的精確匹配題,24%為復選題。此外,約14%的題目為多模態問題,需要模型同時理解文本和圖像信息才能作答。
為實現防過擬合設計,HLE在公開發布2500道題作為基準的同時,保留了一個不對外公布的私有測試集(private set),用於檢測模型是否過擬合公開數據。此外,其數據集中嵌入了獨特的“金絲雀”字元串(Canary String),用於追蹤數據是否被意外納入訓練集。
