研發歷程,研究背景,技術原理,相關數據集,性能突破,套用領域,技術局限,開源計畫,
研發歷程
FoundationMotion由麻省理工學院的甘雨露教授領導、聯合英偉達、密西根大學、加州大學伯克利分校和史丹福大學的研究團隊於2025年12月11日首次提出。其相關論文‘FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos’於同日發布於arXiv預印本伺服器,編號為arXiv:2512.10927v1。
研究背景
運動理解是物理推理的基礎,但現有視覺-語言模型在真實世界視頻的運動分析上仍表現不足,其關鍵限制在於缺乏大規模、細粒度的運動標註數據。手動標註成本極高,且難以覆蓋複雜運動場景,導致模型難以學習“物體如何運動、空間關係如何變化”的深層邏輯。
技術原理
FoundationMotion採用全自動的數據標註流水線,其核心技術流程可概括為“檢測-跟蹤-生成”三步。在視頻預處理階段,系統對原始視頻進行裁剪,並過濾掉攝像機劇烈運動的片段。
在物體檢測與跟蹤階段,系統使用開放辭彙檢測器識別視頻中的通用物體,並採用人類中心檢測流水線聚焦於人機互動場景。隨後,使用時序跟蹤技術如SAM2維持物體在視頻跨幀間的一致性。在信息生成階段,跟蹤數據被輸入大語言模型GPT-4o-mini,轉化為包含七個維度的自然語言描述。同時,系統生成動作識別、時間順序、物體關聯、空間位置和重複計數五種類型的運動理解問答對,以模擬運動邏輯推理需求。這一流程最終構建了大規模的FoundationMotion Dataset。
相關數據集
FoundationMotion Dataset是由FoundationMotion全自動數據標註pipeline生成的大規模視頻運動理解數據集。該數據集包含50萬組“視頻-描述-問答”數據對,基於約4.67萬個視頻生成。其標註密度達到1.671個問題/秒,視頻片段的平均長度約為17.5秒。
數據格式包含邊界框JSON,用於問答生成。其設計的五種問答類型,包括動作識別、時間順序、物體關聯、空間位置和重複計數,相互互補以覆蓋運動推理的不同方面。
性能突破
微調相關模型後,在MotionBench評測集上的準確性提升至46.7%,在AV-Car評測集上的性能提升7.1%,最終達到41.3%。該模型的性能在部分任務上超越了同期的閉源大模型。
FoundationMotion數據集採用了5類運動理解問答對,這些類型設計實現了性能互補;同時,包含物體邊界框的JSON數據格式被證實能有效提升問答對的生成質量。
套用領域
FoundationMotion的套用驗證涵蓋自動駕駛、日常生活場景、機器人套用和醫療健康領域,模型在自動駕駛、機器人和視頻分析等套用領域性能提升。
技術局限
其技術局限性包括主要處理二維平面運動;對快速運動或存在運動模糊的場景,準確性可能下降;對某些與文化背景強相關的手勢或動作的理解存在局限。
開源計畫
研究團隊承諾開源所有代碼、數據和評估基準。
