發展歷史
2025年5月21日,2025 年 I/O 開發者大會上,谷歌推出了 Gemma 3n 端側多模態 AI 模型,可以在手機、平板和筆記本電腦上本地運行,處理音頻、文本、圖片和視頻多種數據類型。
2025年6月27日,科技媒體 NeoWin發布博文,報導稱在 2025 年 I/O 開發者大會上預覽發布後,谷歌已正式推出 Gemma 3n 端側多模態模型,支持在手機、平板和筆記本電腦上本地運行,處理音頻、文本、圖片和視頻多種數據類型。
產品特點
Gemma 產品經理 Gus Martins 透露,Gemma 3n 可以在記憶體小於 2GB 的設備上運行,採用 Gemini Nano 同款架構,但性能表現更出色。他強調:“Gemma 3n 為設備端 AI 套用帶來了驚人的表現力。”
IT之家援引博文介紹,Gemma 3n 的最大亮點在於採用了谷歌 DeepMind 開發的 Per-Layer Embeddings(PLE)技術,顯著降低了模型的記憶體需求。儘管其參數量分別為 5B 和 8B,但記憶體占用僅相當於 2B 和 4B 模型。
谷歌宣稱,Gemma 3n 的記憶體占用分別低至 2GB 和 3GB。此外,通過 PLE、KVC 共享和高級激活量化等技術,Gemma 3n 在移動設備上的回響速度提升 1.5 倍,質量也優於 Gemma 3 4B 版本。
Gemma 3n 在非英語語言處理上也有突破,尤其在日語、德語、韓語、西班牙語和法語中表現優異,在多語言基準測試 WMT24++ 中,該模型得分高達 50.1%。
用戶無需任何設定,目前可通過 Google AI Studio 直接在瀏覽器中使用 Gemma 3n;開發者則可通過 Google AI Edge 集成本地功能,支持文本和圖像理解與生成,未來還將擴展更多能力。
功能配置
最新發布的 Gemma 3n 完整版進一步提升性能表現,支持在 2GB 記憶體的硬體上本地運行,重點提升了編碼和推理方面的能力。
Gemma 3n 共有兩種規模版本,其中 E2B 共有 50 億(5B)參數,支持在 2GB 以上記憶體設備上運行;E4B 共有 80 億(8B)參數,支持在 3GB 以上記憶體設備上運行,兩者通過架構創新,記憶體占用相當於 20 億(2B)和 40 億(4B)模型。
在架構方面,Gemma 3n 創新採用 MatFormer 架構,來提供計算靈活性,此外使用 Per Layer Embeddings(PLE)以提升記憶體效率、MobileNet-v5 視覺編碼器等等。
對於 MatFormer 架構,谷歌用一個俄羅斯套娃的比喻來描述:一個較大模型內部包含一個較小但完全功能的版本,讓單一模型能夠根據不同任務以不同大小運行。
Gemma 3n 在多語言(支持 140 種語言的文本和 35 種語言的多模態理解)、數學、編碼和推理方面都實現了質量提升。
在性能基準方面,較大的 E4B 模型是首個參數量低於 10B 但 LMArena 得分超過 1300 的模型。
模型的音頻能力現在支持設備上的語音轉文本和翻譯,使用一個能夠處理細緻語音的編碼器。
視覺方面則由一個名為 MobileNet-V5 的新編碼器提供動力,比前代更快、更高效。它能在 Google Pixel 設備上以最高 60FPS 處理視頻。