LongCat-Flash-Omni

LongCat-Flash-Omni

LongCat-Flash-Omni是2025年11月3日美團發布並開源的全模態模型。該模型基於LongCat-Flash系列的高效架構設計(Shortcut-Connected MoE,含零計算專家),創新性集成高效多模態感知模組與語音重建模組。

LongCat-Flash-Omni採用總參數5600億(激活參數270億)的架構規模,在開源範疇內實現對標閉源模型的全模態覆蓋能力。其端到端一體化架構整合多模態理解與實時音視頻互動能力,通過輕量級音頻解碼器重建自然語音波形,實現毫秒級回響和低延遲互動。該模型在全模態基準測試中達到開源最先進水平(SOTA),同時在文本、圖像、視頻理解及語音生成等單模態任務中展現強勁表現。目前模型代碼已在Hugging Face和Github平台開源。

基本介紹

  • 軟體名稱:LongCat-Flash-Omni
  • 上線時間:2025年11月3日
  • 開發商:美團
發展歷程,主要功能,

發展歷程

2025年11月3日,美團發布並開源全模態模型LongCat-Flash-Omni。LongCat官方套用已同步上線,目前支持聯網搜尋和語音通話功能,視頻通話功能將在後續逐步開放。

主要功能

LongCat-Flash-Omni 以 LongCat-Flash 系列的高效架構設計為基礎( Shortcut-Connected MoE,含零計算專家),同時創新性集成了高效多模態感知模組與語音重建模組。
LongCat-Flash-Omni是業界首個實現“全模態覆蓋、端到端架構、大參數量高效推理”於一體的開源大語言模型,在開源範疇內實現了對標閉源模型的全模態能力,並憑藉創新的架構設計與工程最佳化,讓大參數模型在多模態任務中實現毫秒級回響。
該模型的核心創新在於有效解決了大規模參數與實時高效推理之間的固有矛盾。其基於LongCat-Flash系列獨有的ScMoE架構,引入零計算專家機製作為語言模型骨幹,結合高效的多模態編解碼技術,以及獨創的“分塊式音視頻特徵交織機制”,實現了高質量、低延遲的跨模態內容處理,支持流式語音生成與複雜音視頻互動。
在實際性能方面,LongCat-Flash-Omni支持高達128K tokens的上下文長度,並可處理超過8分鐘的連續音視頻輸入,在多模態長時記憶、多輪對話連貫性以及時序邏輯推理等場景中表現出明顯優勢。測試結果顯示,其圖像理解能力與先進閉源模型Gemini-2.5-Pro相當,優於開源同類Qwen3-Omni;在短視頻理解任務中表現超越現有模型,長視頻處理能力亦接近Gemini-2.5-Pro水平。

相關詞條

熱門詞條

聯絡我們