混元Large-Vision

混元Large-Vision是混元多模態理解模型,採用MoE架構,激活參數52B,支持任意解析度圖像、視頻、3D空間輸入,重點提升多語言場景理解能力。

基本介紹

  • 中文名:混元Large-Vision
  • 發布方:騰訊
產品評測,產品組成,

產品評測

該模型在國際LMArena Vision排行榜取得1256分,位列第五名(國內模型第一名),與GPT-4.5和Claude-4-Sonnet處於同一水平。

產品組成

模型基於三個核心模組構成:數十億參數的原生解析度混元ViT視覺編碼器、自適應下採樣MLP連線器和389B參數的MoE語言模型,技術團隊還拓展400B tokens高質量多模態指令數據用於訓練。

相關詞條

熱門詞條

聯絡我們