LongCat-Video

LongCat-Video是美團LongCat團隊於2025年10月27日發布並開源的視頻生成模型,基於Diffusion Transformer(DiT)架構構建的多功能統一視頻生成基座。該模型原生支持文生視頻、圖生視頻和視頻續寫三大核心任務,通過“條件幀數量”機制區分任務類型(文生無需條件幀、圖生輸入1幀、視頻續寫需多幀前序內容),形成完整任務閉環且無需額外模型適配。其文生視頻任務可生成720p/30fps高清視頻,精準解析文本中的物體、人物、場景及風格細節指令,語義理解與視覺呈現能力達到開源SOTA級別。

模型依託原生視頻續寫任務預訓練,實現5分鐘級別長視頻連貫生成,保持跨幀時序一致性與物理運動合理性,並通過塊稀疏注意力(BSA)與條件token快取機制降低推理冗餘。採用“二階段粗到精生成(C2F)+塊稀疏注意力(BSA)+模型蒸餾”三重最佳化技術,視頻推理速度提升至10.1倍。136億參數基座模型在文生視頻、圖生視頻任務中綜合性能達到開源領域最先進水平,並計畫融入自動駕駛、具身智慧型等深度互動業務場景。

基本介紹

  • 外文名:LongCat-Video
  • 研發單位:美團LongCat團隊
簡介,發展歷史,

簡介

LongCat-Video將融入自動駕駛、具身智慧型等深度互動業務場。

發展歷史

2025年10月27日,美團LongCat團隊發布並開源LongCat-Video。

相關詞條

熱門詞條

聯絡我們