UniPat AI

UniPat AI是一個研究團隊。2026年1月12日,該團隊與紅杉中國xbench及多家大模型公司、高校的研究人員共同發布了多模態理解評測集BabyVision。

BabyVision用於評估大模型的純視覺能力。評測集包含20道視覺中心任務,其設計嚴格控制對語言的依賴,要求答案完全基於視覺信息得出。首輪測試結果顯示,參與測試的多數多模態大模型在相關視覺任務上的表現低於3歲兒童的水平。研究團隊分析指出,模型在精細辨別、視覺追蹤、空間感知及視覺模式識別等類別上存在不足,反映了其在基礎視覺能力方面的缺失。團隊認為,未來模型需要加強視覺能力本身,而非依賴語言推理,以推進多模態智慧型的發展。

團隊概況,重要事件,主要科研成果,項目意義與行業影響,

團隊概況

UniPat AI主要關注真實場景下人工智慧的訓練、評測與套用等領域的工作。
2026年1月12日,紅杉中國旗下xbench與UniPat AI團隊,聯合多家大模型公司及高校研究人員,共同發布了多模態理解評測集BabyVision,該評測集主要用於評估大模型的核心視覺能力。

重要事件

2026年01月12日,紅杉中國xbench攜手UniPat AI團隊,並聯合多家大模型公司與高校的研究員,發布了多模態理解評測集BabyVision。
該評測集首輪測試的結果顯示,當前絕大多數頂尖多模態大模型在視覺任務上的表現,低於3歲兒童水平。

主要科研成果

2026年1月12日,UniPat AI攜手紅杉中國xbench並聯合多家大模型公司與高校的研究員,共同發布了旨在精準測評大模型核心視覺能力的多模態理解評測集BabyVision。該評測集致力於構建真實場景下AI訓練、評測與套用的新範式。
評測集首輪測試使用了BabyVision-Mini版本,設計了包含20道視覺中心任務,並嚴格控制語言依賴,所有題目答案均需完全依靠視覺信息得出。評測涵蓋精細辨別、視覺追蹤、空間感知以及視覺模式識別四大類視覺能力。
首輪測試結果顯示,當前絕大多數頂尖多模態大模型的視覺任務表現顯著低於3歲兒童水平,僅有一款模型勉強超過3歲基線。團隊還分別組織了3歲、6歲、10歲、12歲四個年齡段的兒童作為對照組進行測試。
研究團隊指出,這暴露了大模型在基礎視覺能力上存在系統缺失,並面臨來自“非語言細節”缺失、軌跡追蹤、空間想像能力缺失及圖形規律歸納等典型挑戰。評測集的價值在於將“看懂世界”拆解為可測量、可診斷的原子能力,為多模態大模型的發展提供指導方向。

項目意義與行業影響

BabyVision評測集首輪測試結果顯示,當前絕大多數頂尖多模態大模型的視覺任務表現要顯著低於3歲兒童水平。這揭示了大模型在精細辨別、視覺追蹤、空間感知、視覺模式識別四大基礎視覺能力上存在系統性缺失。
團隊總結出模型面臨的四大典型挑戰,包括非語言細節缺失、軌跡追蹤困難、空間想像能力缺失以及圖形規律歸納難題。其核心原因在於測試題目具有“unspeakable”(不可言說)的特性,導致模型難以依賴語言推理過關。
BabyVision項目將“看懂世界”拆解為可測量、可診斷、可疊代的原子能力,為診斷模型短板、明確疊代方向提供了工具。其研究結論強調,未來多模態智慧型的發展必須從根本上重建視覺能力,補足視覺地基,這對於實現可靠的通用智慧型和具身智慧型至關重要。

熱門詞條

聯絡我們