SAM(Segment Anything Model)是由Meta公司於2023年4月發布的人工智慧通用模型,專注於圖像分割任務。其技術架構採用編碼器-解碼器設計,通過融合圖像特徵與提示信息(如點、框、文本)實現任意物體的高效分割。該模型基於包含1100萬張圖像和11億個標註的數據集訓練,具備零樣本泛化能力,可處理未訓練場景及模糊對象。通過開源模型和數據集,SAM推動了下游套用的創新,涵蓋自動駕駛、醫療影像等領域的計算機視覺任務,被譽為計算機視覺領域的ChatGPT。
基本介紹
- 開發者:Meta公司
- 發布時間:2023年4月
- 技術特點:零樣本泛化
- 模型架構:編碼器-解碼器
- 數據集規模:11億標註
- 套用領域:計算機視覺
技術原理
- 圖像編碼器:基於Vision Transformer(ViT)提取圖像特徵
- 提示編碼器:處理用戶輸入的互動式提示(如點擊、框選)
- 掩碼解碼器:生成高質量分割掩碼並評估置信度
套用領域
- 自動駕駛:通過簡化圖像分割過程,提升效率和準確性,套用於自動駕駛領域
- 醫療影像:醫學影像處理
- 遙感分析:衛星圖像的通用分割與監測
- 工業質檢:圖像分割任務,可用於生產線缺陷檢測
開源影響
- 研究效率提升:SAM的開源數據集SA-1B包含1100萬圖像和11億個mask,大大解放了數據標註領域的生產力
- 衍生模型湧現:如Grounding DINO等融合模型
- 技術平權效應:降低視覺AI開發門檻
