7.4 億參數模型 EmbeddingGemma 2 讓手機端離線搜尋具備多模態能力
重點摘要
- ✦Google 發布 EmbeddingGemma 2 開源模型,能將文字、程式碼、影像、音訊與影片轉化為數值向量,實現離線搜尋與比對。
- ✦該模型具備 7.4 億參數,並針對行動裝置進行優化,僅需約 191MB 至 567MB 的記憶體即可在手機或小型開發板上運行。
- ✦EmbeddingGemma 2 採用 Apache 2.0 授權,不需 API 金鑰即可在地端運作,有助於處理敏感資料並降低對雲端伺服器的依賴。

Google 近期發布了 EmbeddingGemma 2,這是一款具備 7.4 億參數的開源模型,其核心功能在於將文字、程式碼、影像、音訊及影片等多模態內容,轉換為數值向量,讓軟體能透過語意而非僅僅是關鍵字匹配來搜尋與比對資料。這項技術的出現,讓原本必須依賴雲端處理的搜尋與檢索步驟,現在能直接在手機或小型硬體裝置上完成。
Google 釋出 EmbeddingGemma 2 的技術細節與應用差異
根據 Google 的說明,EmbeddingGemma 2 在多模態嵌入基準測試中,表現超越了體積兩倍大的競爭模型。該模型在設計上採取了模組化架構,其中 2.7 億參數用於處理文字,若使用者有需求,則可額外載入 1.7 億參數的影像編碼器與 3 億參數的音訊編碼器。這種靈活的配置方式,使其在處理純文字任務時能保持輕量化。
在效能表現上,該模型在瀏覽器中透過 WebGPU 運行時,每筆查詢僅需 20 到 70 毫秒。對於開發者而言,這意味著在不需將資料傳輸至外部伺服器的情況下,能建構出離線的檢索增強生成(RAG)應用。此外,Google 指出,透過將向量維度從 768 降至 128,能進一步將地端向量資料庫的儲存空間需求縮減至六分之一。
不過,該模型並非完美無缺。Google 在發布文件中明確列出了限制,強調該模型未經過安全性微調,也沒有輸出審核機制,相關的緩解措施僅應用於訓練資料中。此外,雖然模型支援超過 100 種語言,但 Google 也坦言,這些語言之間的效能表現並不均衡。
Google 開源模型系列的發展節點
回顧 Google 的開源布局,Gemma 系列模型在過去已累積超過 10 億次下載,其中第一代 EmbeddingGemma 就佔了 2,000 萬次。今年 4 月,Google 推出了 Gemma 4 系列,支援在手機、樹莓派(Raspberry Pi)開發板及消費級顯示卡上運行。EmbeddingGemma 2 正是基於此架構開發,並共享了相同的文字標記器與音訊編碼器,這使得兩者在合併運行時能顯著節省記憶體空間。
Google 在 8 月時曾展示過一個運行在 80 美元樹莓派上的離線翻譯器,當時便提出了類似的觀點:透過將資料保留在裝置端,能避免敏感對話內容外流。The Next Web 評論指出,資料不必傳出裝置,正是許多歐洲資料保護疑慮的起點。EmbeddingGemma 2 的推出,延續了這一策略,讓使用者能在自有硬體上執行具備搜尋能力的 AI 應用。
開發者現在能採取的實作行動
對於希望導入此技術的開發者,目前 EmbeddingGemma 2 的權重已在 Hugging Face 與 Kaggle 上架,並附帶了開發者指南與說明文件。由於該模型採用 Apache 2.0 授權,開發者可將其整合至各類應用中,特別是針對需要處理隱私敏感資料、或無法維持穩定網路連線的場景。
開發者在實作時,應優先確認目標裝置的記憶體配置。根據 Google 的測試,在 Pixel 11 Pro 上,僅處理文字任務約需 191MB 記憶體,若要同時處理文字、程式碼、影像、音訊與影片這五種模態,則需約 567MB 的記憶體空間。此外,由於模型缺乏輸出審核機制,開發者在應用層面需自行評估內容過濾的必要性,並針對目標語言進行在地化的效能驗證。



