SAM(Meta開發的AI圖像分割模型)

本詞條是多義詞,共22個義項
更多義項 ▼ 收起列表 ▲

SAM(Segment Anything Model)是由Meta公司於2023年4月發布的人工智慧通用模型,專注於圖像分割任務。其技術架構採用編碼器-解碼器設計,通過融合圖像特徵與提示信息(如點、框、文本)實現任意物體的高效分割。該模型基於包含1100萬張圖像和11億個標註的數據集訓練,具備零樣本泛化能力,可處理未訓練場景及模糊對象。通過開源模型和數據集,SAM推動了下游套用的創新,涵蓋自動駕駛、醫療影像等領域的計算機視覺任務,被譽為計算機視覺領域的ChatGPT。

基本介紹

  • 開發者:Meta公司
  • 發布時間:2023年4月
  • 技術特點:零樣本泛化
  • 模型架構:編碼器-解碼器
  • 數據集規模:11億標註
  • 套用領域:計算機視覺
技術原理,套用領域,開源影響,

技術原理

SAM採用三階段架構:
  1. 圖像編碼器:基於Vision Transformer(ViT)提取圖像特徵
  2. 提示編碼器:處理用戶輸入的互動式提示(如點擊、框選)
  3. 掩碼解碼器:生成高質量分割掩碼並評估置信度
模型通過海量數據訓練建立分割通用框架,無需針對特定場景建模即可完成物體識別,在模糊對象或複雜背景中仍保持準確性。

套用領域

截至2024年,SAM已在以下場景實現套用:
  1. 自動駕駛:通過簡化圖像分割過程,提升效率和準確性,套用於自動駕駛領域
  2. 醫療影像:醫學影像處理
  3. 遙感分析:衛星圖像的通用分割與監測
  4. 工業質檢:圖像分割任務,可用於生產線缺陷檢測

開源影響

Meta於2023年4月開放模型代碼與SA-1B數據集,促進學術界與產業界創新:
  1. 研究效率提升:SAM的開源數據集SA-1B包含1100萬圖像和11億個mask,大大解放了數據標註領域的生產力
  2. 衍生模型湧現:如Grounding DINO等融合模型
  3. 技術平權效應:降低視覺AI開發門檻

相關詞條

熱門詞條

聯絡我們