眼鏡猴(視頻理解大模型)

眼鏡猴(視頻理解大模型)

本詞條是多義詞,共2個義項
更多義項 ▼ 收起列表 ▲

眼鏡猴(Tarsier)是由ByteDance Research開發的視頻理解大模型。該模型專注於生成精確的視頻描述,支持視頻分類標註、情感分析及摘要生成等任務,核心技術包括多模態融合技術和創新時間建模機制。其訓練數據基於自建的數百萬小時級全球視頻數據集,並採用分散式訓練框架處理計算壓力。

2025年1月,ByteDance Research推出升級版本Tarsier2。

基本介紹

  • 軟體名稱:眼鏡猴
  • 最近更新時間:2025年1月 
  • 開發商:ByteDanceResearch
  • 外文名:Tarsier
發展歷程,主要功能,

發展歷程

2025年1月,ByteDanceResearch發布Tarsier2視頻理解大模型。

主要功能

眼鏡猴(Tarsier)模型專注於生成精確的視頻描述,支持視頻分類標註、情感分析及摘要生成等任務,核心技術包括多模態融合技術和創新時間建模機制。其訓練數據基於自建的數百萬小時級全球視頻數據集,並採用分散式訓練框架處理計算壓力。模型基於4000萬條視頻-文本對齊數據進行預訓練,具備跨格式視頻理解能力(真人/動畫、橫屏/豎屏),可精準捕捉視覺元素及動態事件。對比顯示Tarsier系列模型為視頻描述領域最強開源模型之一。
數據收集方面:Tarsier2 海量收集網際網路上的視頻 - 文本數據。這些數據分布廣泛,涵蓋電影、電視劇、短視頻等各種來源,涉及人機互動、自動駕駛等多個領域。值得一提的是,Tarsier2 篩選了一大批影視劇解說的視頻。這些視頻不僅能夠幫助模型學會簡單的動作、事件,還能輔助模型理解更高層次的情節信息。
數據篩選方面:Tarsier2 設計了一套嚴謹的流程,來篩選高質量訓練數據。每條數據都會經歷 “分鏡 → 過濾 → 合併” 3 個階段。“分鏡” 階段,視頻會被切分成多個單一鏡頭片段;“過濾” 階段針對不同的數據使用不同的模型過濾低質數據,如過濾掉動態性太差的、文本和畫面無關的等;“合併” 階段再將剩下的相鄰的視頻片段合在一起,增加視頻的複雜度。

相關詞條

熱門詞條

聯絡我們