BrowseComp是由美國開放人工智慧研究中心(OpenAI)研發的測試基準,旨在評估人工智慧瀏覽智慧型體在網際網路上定位複雜關聯信息的能力。該基準針對傳統測試僅關注基本事實檢索的局限性設計,包含1266個挑戰性問題,適用於具備網頁瀏覽功能的AI模型性能評估。
2025年4月10日,OpenAI宣布開源BrowseComp基準測試。測試結果顯示,GPT-4o和GPT-4.5模型的準確率分別為0.6%和0.9%,而配備瀏覽器功能的GPT-4o準確率提升至1.9%。同期發布的Deep Research智慧型體模型在該基準測試中達到51.5%準確率,其自主搜尋和信息整合能力得到驗證。2025年12月,阿里巴巴研究團隊提出的嵌套瀏覽器使用學習方法在該基準測試中達到31.6%準確率。2026年1月5日,MiroMind團隊發布MiroThinker 1.5模型,該模型在BrowseComp測試中取得相應結果,並在BrowseComp-ZH中獲得了更高的評分。月之暗面發布的Kimi K2.5模型在BrowseComp測試中取得74.9%的準確率。
基本介紹
- 外文名:BrowseComp
- 研發單位:OpenAI
