BrowseComp

BrowseComp是由美國開放人工智慧研究中心(OpenAI)研發的測試基準,旨在評估人工智慧瀏覽智慧型體在網際網路上定位複雜關聯信息的能力。該基準針對傳統測試僅關注基本事實檢索的局限性設計,包含1266個挑戰性問題,適用於具備網頁瀏覽功能的AI模型性能評估。

2025年4月10日,OpenAI宣布開源BrowseComp基準測試。測試結果顯示,GPT-4o和GPT-4.5模型的準確率分別為0.6%和0.9%,而配備瀏覽器功能的GPT-4o準確率提升至1.9%。同期發布的Deep Research智慧型體模型在該基準測試中達到51.5%準確率,其自主搜尋和信息整合能力得到驗證。2025年12月,阿里巴巴研究團隊提出的嵌套瀏覽器使用學習方法在該基準測試中達到31.6%準確率。2026年1月5日,MiroMind團隊發布MiroThinker 1.5模型,該模型在BrowseComp測試中取得相應結果,並在BrowseComp-ZH中獲得了更高的評分。月之暗面發布的Kimi K2.5模型在BrowseComp測試中取得74.9%的準確率。

基本介紹

  • 外文名:BrowseComp
  • 研發單位:OpenAI
發展歷史,研發背景,

發展歷史

當地時間2025年4月10日,美國開放人工智慧研究中心(OpenAI)宣布開源包含1266個挑戰性問題的基準測試BrowseComp。
2025年12月,阿里巴巴研究團隊的NestBrowse-30B-A3B在BrowseComp測試中達到31.6%的成功率,高於多數同期系統。
2026年1月5日,MiroMind團隊發布的搜尋智慧型體模型MiroThinker-v1.5-30B在關鍵評測集BrowseComp-ZH中取得較好成績。
與參數量更大的Kimi-K2-Thinking模型相比,MiroThinker-v1.5-30B在BrowseComp-ZH測試中展現了與之相當的表現。
2026年1月27日,月之暗面(Moonshot AI)發布的Kimi K2.5模型在BrowseComp基準測試中取得了74.9%的成功率,達到了較高水平。

研發背景

一個高性能的瀏覽智慧型體應該能夠定位那些難以查找、可能需要在瀏覽數十甚至數百個網站的過程中才能獲取的信息。現有基準測試(如SimpleQA)主要衡量模型檢索基本孤立事實的能力,這類測試已被具備快速瀏覽工具(如支持瀏覽功能的GPT-4o)的模型所飽和。為了衡量AI智慧型體在網際網路上定位難以查找、相互關聯信息的能力,現開源基準測試BrowseComp。

相關詞條

熱門詞條

聯絡我們