xbench是紅杉中國於2025年5月26日發布的開源AI基準測試工具,由紅杉中國聯合卡內基梅隆大學、麻省理工學院等18所高校共同研發,旨在通過雙軌評估體系量化AI系統的能力上限與真實場景效用價值。該工具採用長青評估機制動態更新測試內容,評估結果通過其官方網站實時公開,首期發布科學問題解答測評集(xbench-ScienceQA)與中文網際網路深度搜尋測評集(xbench-DeepSearch)。2025年6月18日,紅杉中國正式開源其AI基準測試工具xbench的兩個評測集xbench-ScienceQA和xbench-DeepSearch。2026年1月12日,xbench與UniPat AI團隊合作,聯合多家大模型公司和高校研究員,發布了新的多模態理解評測集BabyVision。
2023年3月該項目啟動內部研發,2025年5月正式推出並於同年6月18日開源兩個核心評測集,標誌著進入開源套用階段。評測體系涵蓋招聘和行銷領域垂類Agent評估框架,引入項目反應理論構建能力追蹤指數,並通過技術-市場匹配度概念評估AI商業化潛力。工具採用雲原生架構設計,支持多維度評估。在Xbench-DeepResearch等基準測試中,已有第三方開源智慧型體模型展現出優異表現。
基本介紹
- 外文名:xbench
- 所屬公司 :紅杉中國
