Google DeepMind/官方:開源多模態嵌入模型 EmbeddingGemma 2——七億四千萬參數把文字、程式碼、圖像、影片與音訊放進同一向量空間;純文字只需二億七千萬、手機量化後約一百九十一MB 記憶體;程式碼檢索分數升近十分,Apache 2.0 可商用

Key takeaway

Google DeepMind 於十月六日發布開放權重多模態嵌入模型 EmbeddingGemma 2,以 Apache 2.0 授權開放商用。模型總參數七億四千萬,可把文字、程式碼、圖像、影片及音訊映射到同一個七百六十八維向量空間;只做文字檢索時只需載入二億七千萬參數,官方稱量化後在手機上約一百九十一MB 記憶體即可運行。

Google DeepMind/官方:開源多模態嵌入模型 EmbeddingGemma 2——七億四千萬參數把文字、程式碼、圖像、影片與音訊放進同一向量空間;純文字只需二億七千萬、手機量化後約一百九十一MB 記憶體;程式碼檢索分數升近十分,Apache 2.0 可商用

Google DeepMind 於十月六日發布開放權重多模態嵌入模型 EmbeddingGemma 2,以 Apache 2.0 授權開放商用。模型總參數七億四千萬,可把文字、程式碼、圖像、影片及音訊映射到同一個七百六十八維向量空間;只做文字檢索時只需載入二億七千萬參數,官方稱量化後在手機上約一百九十一MB 記憶體即可運行。

對企業而言,重點在於「檢索層」可以完全留在裝置或內網:程式碼檢索基準由六十八點七六升至七十八點六八,上下文擴至八千詞元,並支援把向量截短至一百二十八維以節省最多六倍儲存。本文按 Google 官方網誌、開發者指南及模型卡核實,拆解架構、應用場景與香港企業部署時要留意的地方。

Google DeepMind 開源 EmbeddingGemma 2:一個七億參數模型,離線搜遍文字、程式碼、圖片與影音

去年 Google 推出第一代 EmbeddingGemma,主打在消費級硬件上產生高質素文字嵌入(embedding),官方稱下載量已超過二千萬次,被開發者用來做裝置端搜尋及以私隱為先的檢索增強生成(RAG)流程。十月六日,Google DeepMind 研究工程師 Sahil Dua 與 Henrique Schechter Vera 在 Google 官方網誌發布第二代 EmbeddingGemma 2,把能力由文字擴展至程式碼、圖像、影片及音訊;同日 Google 開發者網誌刊出由 Maarten Grootendorst 與 Ian Ballantyne 撰寫的開發者指南,模型權重亦已上架 Hugging Face(google/embeddinggemma-2)與 Kaggle。

來源真實性已驗證:本文數據核對自 Google 官方網誌原文、Google AI for Developers 上的 EmbeddingGemma 2 模型卡、Google 開發者網誌開發者指南,以及 Hugging Face 官方模型頁(模型頁顯示最後更新為香港時間十月六日晚上十一時二十九分)。以下先講核心規格,再拆解技術原理、日常應用與專業評價。

一、核心事件:同一向量空間容納五種內容

技術細節

根據官方模型卡,EmbeddingGemma 2 的主要規格如下:

  • 參數與模組:總參數七億四千萬,由二億七千萬參數的文字模型(一億三千萬 Transformer 主幹加一億四千萬嵌入層)、一億七千萬參數的視覺編碼器,以及三億參數的音訊編碼器組成。
  • 按需載入:開發者指南列出四種組合——純文字/程式碼二億七千萬、文字加視覺四億四千萬、文字加音訊五億七千萬、全多模態七億四千萬,全部輸出到同一個相容的向量空間。
  • 輸出維度:原生七百六十八維,可用 Matryoshka 表徵學習(MRL)截短至五百一十二、二百五十六或一百二十八維,官方稱最多可節省六倍向量儲存。
  • 上下文:八千一百九十二詞元,是第一代的四倍;官方網誌指可一次處理最長約五分半鐘音訊、二十九張圖片、五十八個影片幀,或以上內容的交錯組合。
  • 語言:模型卡稱支援逾一百種語言。
  • 裝置端記憶體:官方網誌指在 Pixel 11 Pro 上經量化後,純文字權重約需一百九十一MB 活躍記憶體,全多模態約五百六十七MB。
  • 授權:Apache 2.0,可商用。

模型以 Gemma 4 架構為基礎,並與 Gemma 4 共用文字分詞器及音訊編碼器架構。Google 指這意味着開發者若把 EmbeddingGemma 2(負責檢索)與 Gemma 4(負責生成回答)放在同一條裝置端 RAG 流程,總記憶體佔用會較分開部署兩套模型為低。

基準成績

模型卡以全精度、七百六十八維輸出公布以下成績:

  • 多語文字 MTEB(v2):六十一點三六(第一代為六十一點一五)
  • 程式碼 MTEB(v1):七十八點六八(第一代為六十八點七六,升九點九二分)
  • 圖像 MIEB(lite):六十四點六四
  • 多模態 MMEB v2:圖像五十七點二八、視覺文件六十七點八四、影片五十點六七
  • 音訊:MSEB 檢索六十九點五四、MAEB 四十九點三九

截短維度後的取捨亦有公布:截至二百五十六維時,多語文字 MTEB 為六十點四一、程式碼為七十六點一八;截至一百二十八維時程式碼跌至七十一點四一、MMEB 整體由五十九點零一跌至四十五點六五。模型卡的建議是二百五十六維以上品質影響輕微,一百二十八維較適合純文字工作負載。

二、技術原理深度解析

嵌入模型是 RAG 的「檢索層」。生成式模型負責寫答案,但要先由嵌入模型把文件、圖片或錄音轉成向量,存入向量資料庫,查詢時再以相似度找出最相關的片段交給生成模型。檢索質素差,後面的模型再強也會「答錯題」。

模組化編碼器取代串接多個模型。過往要做「用文字搜影片」,常見做法是先用語音轉文字、圖像描述模型把影音轉成文字,再做文字嵌入,流程長、延遲高、資訊亦會在轉換中流失。EmbeddingGemma 2 讓視覺與音訊編碼器直接把原始內容投射到共用主幹,所有模態的向量落在同一空間,可以直接比較相似度。開發者指南示範了以一句文字查詢同時比對相片與錄音,以及把「文字+產品相+測試影片」合成一個向量代表一件貨品。

任務指令前綴。模型以簡短任務前綴訓練,例如搜尋查詢用「task: search result | query: …」,文件則用「title: … | text: …」格式;檢索這類非對稱任務,查詢與文件要用不同前綴,分類與相似度等對稱任務則用同一前綴。官方指省略前綴仍可運作,但準確度會下降——這是企業移植舊系統時最容易忽略的細節。

MRL 截短。Matryoshka 表徵學習令向量的前段已包含最重要的資訊,因此可直接截短再重新正規化,不必另訓練小模型。查詢與文件必須使用相同維度。

三、日常應用場景

1. 開發者與技術團隊

程式碼檢索分數的升幅,令它適合做本地程式碼庫索引、語意化程式碼搜尋,以及編程代理(coding agent)的檢索層——程式碼毋須上傳到第三方嵌入 API。官方列出的支援工具相當齊全:transformers、sentence-transformers(多模態需 v6.1.0 或以上)、MLX、vLLM、llama.cpp、SGLang、Ollama 及 LM Studio;瀏覽器端可用 transformers.js 或 WebGPU;Android 等裝置端則有 Google AI Edge 的 MediaPipe 與 LiteRT;微調可參考 Unsloth 指南。Google 雲端 Gemini Enterprise Agent Platform Model Garden 版本則標示為「即將推出」。

2. 企業與隱私敏感行業

銀行、保險、律師行、醫療機構常有大量掃描文件、簡報、會議錄音與培訓影片,過往要把它們變成可搜尋的知識庫,往往要把內容送到雲端 API。EmbeddingGemma 2 的視覺編碼器支援 PDF、簡報、圖表等視覺文件,加上音訊直接嵌入,可在內網伺服器甚至員工手提電腦上建立跨格式搜尋,減少數據外傳。MediaPipe 的 Decision Task API 亦可把多模態向量用作分類與路由,例如把客服來電錄音自動分派到合適部門。

3. 一般用戶

Google 以三個示範應用說明用途:Google AI Edge Gallery 的「Instant Media Search」可用文字或圖片搜手機相簿;「Video Moments Finder」可用文字或語音找出影片中的某一刻;Google AI Edge Foresight 則把 EmbeddingGemma 2 的本地檔案檢索與 Gemma 4 的推理結合。這類功能在離線狀態下亦能運作。

4. 香港與亞洲市場視角

香港企業處理客戶資料須遵從《個人資料(私隱)條例》,跨境傳送及委託第三方處理數據一直是採用雲端 AI 的顧慮。一個能在本地硬件運行、以 Apache 2.0 授權商用的多模態嵌入模型,令「資料不出公司」的 RAG 方案門檻降低:媒體機構可為多年新聞片庫建立以文字搜畫面的索引;零售及電商可以「文字+相片+短片」統一商品搜尋;金融機構可為內部合規文件與會議錄音建立可審計的本地知識庫。

需要提醒的是,模型卡只寫明「逾一百種語言」,並未單獨列出粵語口語或香港繁體中文的成績。涉及廣東話錄音、中英夾雜文件或本地專有名詞的應用,上線前應以自家數據做檢索評測,必要時按官方指引微調。

四、專業評價與潛在考量

優勢

  • 一個模型、五種內容:省去串接語音轉文字、圖像描述等多個模型的流程,延遲與維運成本都較低。
  • 體積細、可按需載入:純文字二億七千萬參數,對內網 CPU 伺服器或邊緣裝置友善。
  • 儲存成本可調:MRL 截短讓企業在向量資料庫規模與檢索品質之間自行取捨。
  • 授權寬鬆、生態齊全:Apache 2.0 加上主流推理框架與裝置端工具即日支援,落地阻力小。

需要留意的地方

  • 多語文字進步有限:多語 MTEB 由六十一點一五只升至六十一點三六,大部分升幅集中在程式碼與新增的多模態能力;純文字中文檢索未必較第一代明顯改善。
  • 基準是官方自測:成績來自 Google 模型卡的全精度版本,量化後在手機上的實際準確度需自行驗證。
  • 向量不能混用:由第一代或其他嵌入模型轉用,須重新為整個資料庫生成向量,查詢與文件亦必須用同一維度與正確前綴。
  • 媒體長度有上限:八千詞元約對應五分半鐘音訊或五十八個影片幀,長片與長錄音仍需切段處理。

結語

EmbeddingGemma 2 的意義不在於刷新某一項排行榜,而在於把「跨文字、程式碼、圖片與影音的語意搜尋」壓縮到一部手機或一台內網伺服器就能跑的體積,並以可商用授權開放。對重視數據主權的企業,這代表 RAG 系統的檢索層可以更容易留在自己手上;下一步要看的是 Model Garden 版本推出時間、社區量化版本的實測表現,以及在粵語與中英夾雜內容上的檢索質素。

如企業想在香港建立資料不出境的私有知識庫或 RAG 系統,可參考 YSK Limited 的企業私有 LLM 全託管,年費 HK$88,000 起,由 Dataset 整理、QLoRA/LoRA 微調到私有 API 部署,100% 數據不出境(https://ysk.hk/services/ai-automation)。技術團隊若想先在本機試行 Hugging Face 開放模型,亦可了解 YSK Omni v1.0.2——一個架在本地 Hugging Face 權重前面的 OpenAI 相容 HTTP 閘道,MIT 開源、預設埠 3850(https://ysk.hk/products/ysk-omni)。


參考來源

  1. Google 官方網誌:EmbeddingGemma 2: an open, lightweight multimodal embedding model(2026-10-06)https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
  2. Google AI for Developers:EmbeddingGemma 2 model card https://ai.google.dev/gemma/docs/embeddinggemma/model_card_2
  3. Google 開發者網誌:EmbeddingGemma 2: The Developer Guide(2026-10-06)https://developers.googleblog.com/en/embeddinggemma-2-the-developer-guide/
  4. Hugging Face 官方模型頁:google/embeddinggemma-2 https://huggingface.co/google/embeddinggemma-2
  5. Kaggle 模型頁:google/embeddinggemma-2 https://www.kaggle.com/models/google/embeddinggemma-2
  6. 發現來源:Google 官方網誌 RSS

Related services & products