FoundationMotion

FoundationMotion是由麻省理工學院、英偉達、密西根大學、加州大學伯克利分校及史丹福大學的研究團隊於2025年12月11日聯合發布的視頻運動理解框架。

該框架旨在解決現有視覺-語言模型在視頻運動分析上因缺乏大規模細粒度標註數據而表現不足的問題。它採用全自動數據標註流程,通過“檢測-跟蹤-生成”三步提取視頻中的運動信息,並利用GPT-4o-mini生成包含運動描述與問答對的結構化數據。基於此流程構建的FoundationMotion Dataset包含50萬組“視頻-描述-QA”對,使用該數據集微調相關模型後,在MotionBench、AV-Car等評測中性能顯著提升。

研發歷程,研究背景,技術原理,相關數據集,性能突破,套用領域,技術局限,開源計畫,

研發歷程

FoundationMotion由麻省理工學院的甘雨露教授領導、聯合英偉達、密西根大學、加州大學伯克利分校和史丹福大學的研究團隊於2025年12月11日首次提出。其相關論文‘FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos’於同日發布於arXiv預印本伺服器,編號為arXiv:2512.10927v1。

研究背景

運動理解是物理推理的基礎,但現有視覺-語言模型在真實世界視頻的運動分析上仍表現不足,其關鍵限制在於缺乏大規模、細粒度的運動標註數據。手動標註成本極高,且難以覆蓋複雜運動場景,導致模型難以學習“物體如何運動、空間關係如何變化”的深層邏輯。

技術原理

FoundationMotion採用全自動的數據標註流水線,其核心技術流程可概括為“檢測-跟蹤-生成”三步。在視頻預處理階段,系統對原始視頻進行裁剪,並過濾掉攝像機劇烈運動的片段。
在物體檢測與跟蹤階段,系統使用開放辭彙檢測器識別視頻中的通用物體,並採用人類中心檢測流水線聚焦於人機互動場景。隨後,使用時序跟蹤技術如SAM2維持物體在視頻跨幀間的一致性。在信息生成階段,跟蹤數據被輸入大語言模型GPT-4o-mini,轉化為包含七個維度的自然語言描述。同時,系統生成動作識別、時間順序、物體關聯、空間位置和重複計數五種類型的運動理解問答對,以模擬運動邏輯推理需求。這一流程最終構建了大規模的FoundationMotion Dataset。

相關數據集

FoundationMotion Dataset是由FoundationMotion全自動數據標註pipeline生成的大規模視頻運動理解數據集。該數據集包含50萬組“視頻-描述-問答”數據對,基於約4.67萬個視頻生成。其標註密度達到1.671個問題/秒,視頻片段的平均長度約為17.5秒。
數據格式包含邊界框JSON,用於問答生成。其設計的五種問答類型,包括動作識別、時間順序、物體關聯、空間位置和重複計數,相互互補以覆蓋運動推理的不同方面。

性能突破

微調相關模型後,在MotionBench評測集上的準確性提升至46.7%,在AV-Car評測集上的性能提升7.1%,最終達到41.3%。該模型的性能在部分任務上超越了同期的閉源大模型。
FoundationMotion數據集採用了5類運動理解問答對,這些類型設計實現了性能互補;同時,包含物體邊界框的JSON數據格式被證實能有效提升問答對的生成質量。

套用領域

FoundationMotion的套用驗證涵蓋自動駕駛、日常生活場景、機器人套用和醫療健康領域,模型在自動駕駛、機器人和視頻分析等套用領域性能提升。

技術局限

其技術局限性包括主要處理二維平面運動;對快速運動或存在運動模糊的場景,準確性可能下降;對某些與文化背景強相關的手勢或動作的理解存在局限。

開源計畫

研究團隊承諾開源所有代碼、數據和評估基準。

相關詞條

熱門詞條

聯絡我們