Qwen2.5-VL

Qwen2.5-VL是阿里通義千問於2025年1月28日開源的視覺語言模型,屬於Qwen模型家族的旗艦產品。該模型推出了3B、7B和72B三個尺寸版本,其中72B版本在13項權威評測中視覺理解能力全面超越GPT-4o與Claude3.5。Qwen2.5-VL具備多模態理解能力,能夠精準解析圖像中的物體、文本、圖表等元素,並支持超過1小時的長視頻內容理解及事件定位。此外,該模型無需微調即可作為視覺智慧型體操控設備,執行多步驟複雜任務。其結構化輸出功能適用於金融、商業等領域的數據處理。

基本介紹

  • 類型:視覺語言模型
  • 發布時間:2025年1月
  • 版本:3B/7B/72B
  • 開源狀態:已開源
  • 視頻理解:1小時以上
  • 套用領域:金融、商業等
模型特點,性能評測,技術改進,未來計畫,

模型特點

Qwen2.5-VL作為多模態模型,主要特點包括:
  1. 視覺解析能力: 準確識別常見物體,分析圖像中的、圖表、圖示及布局結構,支持關鍵信息抽取。
  2. 長視頻理解: 能夠解析超過1小時的視頻內容,精準定位事件片段並總結要點。
  3. 視覺智慧型體功能: 無需微調即可操控手機、電腦,完成查詢天氣、訂機票等複雜任務。
  4. 結構化輸出: 支持發票、表單、表格等數據的結構化處理,適用於金融和商業領域。

性能評測

截至2025年1月,Qwen2.5-VL-72B-Instruct在13項權威評測中奪得視覺理解冠軍,全面超越GPT-4o與Claude3.5。Qwen2.5-VL-7B-Instruct在多個任務中表現優於GPT-4o-mini,而3B版本作為端側模型超越此前7B版本性能。

技術改進

與Qwen2-VL相比,Qwen2.5-VL增強了時間和空間尺度感知能力,簡化網路結構以提升效率。模型架構調整後,推理速度和資源消耗得到最佳化。

未來計畫

阿里通義千問計畫進一步提升模型的問題解決與推理能力,整合更多模態,打造處理多種輸入的綜合全能模型。

熱門詞條

聯絡我們