CrossPoint

CrossPoint是一種用於3D點雲理解的自監督跨模態對比學習方法,由Mohamed Afham等人於2022年在CVPR會議上提出。該方法通過最大化3D點雲與對應2D渲染圖像在不變空間中的一致性來學習可轉移的3D點雲表示,同時鼓勵對點雲變換的不變性。

實驗表明其在3D物體分類、分割等下游任務上優於先前無監督方法。相關代碼和預訓練模型已公開,並在後續更新中增加了對分散式訓練的支持。

基本介紹

  • 外文名:CrossPoint
方法含義與背景,技術原理,實現與套用,下游任務與性能,論文與作者信息,

方法含義與背景

CrossPoint是一種用於3D點雲理解的自監督跨模態對比學習方法,由Mohamed Afham等人於2022年在CVPR會議上提出。該方法的核心目標是學習可遷移的3D點雲表示。其提出背景在於,由於點雲結構的不規則性,對大規模點雲數據集進行人工標註以用於3D物體分類、分割等任務通常十分費力。受人類能夠將從2D圖像學到的視覺概念映射到3D世界這一直覺啟發,CrossPoint通過最大化3D點雲與其對應渲染的2D圖像在不變空間中的一致性,並鼓勵對點雲模態內變換的不變性,來實現物體的3D-2D對應。該方法屬於計算機視覺與模式識別領域,旨在以自監督的方式解決3D點雲理解中的標註難題。

技術原理

CrossPoint是一種簡單的跨模態對比學習方法,用於學習可遷移的3D點雲表示。它通過在不變數空間中最大化點雲與對應渲染的2D圖像之間的一致性來實現對象的3D-2D對應,同時鼓勵對點雲模態中的變換保持不變性。聯合訓練目標結合了模態內和跨模態的特徵對應,從而以自監督的方式從3D點雲和2D圖像兩種模態中集成豐富的學習信號。

實現與套用

CrossPoint的官方實現代碼、預訓練模型及數據集已開源。該代碼庫於2023年3月25日更新,增加了對PyTorch DistributedDataParallel分散式訓練的支持。其預訓練模型基於DGCNN特徵提取器構建,代碼框架參考了DGCNN的公開實現。用戶可通過提供的腳本進行模型訓練,並線上性支持向量機分類、少樣本分類以及部件分割等下游任務上進行評估和微調。

下游任務與性能

實驗結果表明,CrossPoint在包括3D物體分類和分割在內的多種下游任務中的表現優於先前的無監督學習方法。主要下游任務包括3D物體分類、少樣本物體分類和3D物體部件分割。3D物體分類和少樣本分類實驗主要在ModelNet40和ScanObjectNN數據集上進行,物體部件分割實驗則在ShapeNetPart數據集上進行。代碼和預訓練模型已開源。

論文與作者信息

論文標題為CrossPoint: Self-Supervised Cross-Modal Contrastive Learning for 3D Point Cloud Understanding。該論文發表於IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2022,發表時間為2022年6月,會議頁碼為9892-9902頁。論文的DOI為10.1109/CVPR52688.2022.00967,arXiv預印本編號為arXiv:2203.00680 [cs.CV]。
論文作者包括Mohamed Afham(莫拉圖瓦大學電子與通信工程系,斯里蘭卡)、Isuru Dissanayake(莫拉圖瓦大學電子與通信工程系,斯里蘭卡)、Dinithi Dissanayake(莫拉圖瓦大學電子與通信工程系,斯里蘭卡)、Amaya Dharmasiri(莫拉圖瓦大學電子與通信工程系,斯里蘭卡)、Kanchana Thilakarathna(悉尼大學,澳大利亞)以及Ranga Rodrigo(莫拉圖瓦大學電子與通信工程系,斯里蘭卡)。

相關詞條

熱門詞條

聯絡我們