Google 推出 EmbeddingGemma 2:7.4 億參數,讓手機離線搜尋照片、影音與程式碼
Google 把文字、照片、影音與程式碼放進同一個搜尋空間。EmbeddingGemma 2 有哪些可用示範,手機記憶體數字又該怎麼看?
EmbeddingGemma 2 是 Google 新推出的多模態嵌入模型,能把文字、程式碼、圖片、影片與聲音轉成可比較的數字,讓應用程式依照內容的意思搜尋資料。它的用途是找出相關內容,若要把搜尋結果整理成一段回答,還需要搭配生成模型。
Google 在 2026 年 10 月 6 日公布這款模型,將完整模型規模控制在 7.4 億個參數,並提供只載入部分功能的選項。對想在手機或筆電建立私人資料搜尋的開發者來說,這代表照片、會議錄音與文件有機會共用一套搜尋方式,並在裝置上完成處理。消息與產品定位可見 Google 官方公告。
這次更新值得關注,因為它把跨格式搜尋帶進較小的模型。實際部署仍要看資料量與裝置效能,尤其官方最低記憶體數字有特定條件。理解它如何搜尋、怎麼節省資源,以及哪些限制會影響使用,才能判斷自己的產品是否適合採用。

EmbeddingGemma 2 如何用一句話搜尋照片與影音?
許多人找不到舊照片,是因為記得畫面,卻忘了檔名。例如想找「海邊夕陽下的一隻狗」,檔案名稱可能只是手機自動產生的日期與流水號。語意搜尋會依照內容的意思比對,因此有機會找出沒有這段文字標籤的照片。
這種搜尋需要先建立嵌入向量。嵌入是把內容轉成一組數字的過程,向量就是這組用來描述內容特徵的數字。系統把搜尋句子與資料都轉成向量,再比較它們的相似程度,將較相關的項目排在前面。
EmbeddingGemma 2 的特色是讓不同格式共用同一個向量空間。照片、文字與音訊經過各自的處理模組後,會輸出到同一套 768 維表示方式。「768 維」可以理解為每份內容以 768 個數值描述,讓原本格式不同的資料能放在同一套尺度上比較。Google 開發者指南說明了這項設計與跨格式比對方式。
因此,搜尋介面可以接收文字,也可以接收圖片或聲音。Google 舉例,使用者可以用語音備忘錄找相關影片片段,或用文字搜尋錄音內容。這些是官方描述的應用方向,搜尋是否符合使用者的意思,仍由實際資料與查詢方式決定。
手機上的官方示範:找照片,也找影片中的某一刻
Google 已經把跨格式搜尋做成可體驗的示範。在 Google AI Edge Gallery 這個展示裝置端 AI 能力的應用程式中,Instant Media Search 可以用自然語言或範例圖片搜尋照片與影片。使用者輸入描述時,結果會隨著內容更新,不必先替每張照片手動貼標籤。
Video Moments Finder 則把搜尋範圍縮小到影片中的時刻。依照官方說明,系統先在裝置上為影像與音訊片段建立索引,也就是整理出可供搜尋的內容清單。使用者輸入「狗接飛盤」或「有人吹生日蠟燭」這類描述後,系統會標出相符的時間點。
這種能力對整理家庭影像、課程錄影或工作素材有實際用途。以課程錄影為例,若系統能找到老師展示某張圖的時刻,使用者就能少花時間拖動進度條。這類情境的成效仍要用實際課程素材驗證。
Google 也推出 Mac 上的實驗性應用 Google AI Edge Foresight,搭配 EmbeddingGemma 2 與 Gemma 4,展示會議筆記與私人檔案檢索。它提供另一個方向:搜尋模型先找資料,生成模型再利用找出的內容協助整理。官方示範與下載入口集中在 Google AI Edge 介紹頁。
7.4 億參數可以拆開載入,191 MB 有測試條件
開發者不必為純文字搜尋載入全部功能。EmbeddingGemma 2 採用模組化設計,可以依資料種類選擇處理模組。參數是模型學習到的數值,規模較小通常有助於降低運算與儲存負擔,但參數量本身不能直接換算成整個應用程式的記憶體用量。
| 要處理的內容 | 官方提供的模型配置 | 參數量 |
|---|---|---|
| 文字、程式碼 | 文字主體 | 2.7 億 |
| 文字、圖片、影片影格 | 文字主體加視覺模組 | 4.4 億 |
| 文字、音訊 | 文字主體加音訊模組 | 5.7 億 |
| 全部格式 | 文字、視覺與音訊模組 | 7.4 億 |
依照 Google 開發者指南,這些配置共用同一個向量空間。開發者先建立文字搜尋,再加入圖片或音訊時,只要維持相容的輸出維度,就能沿用已算好的文字向量。這讓產品可以先從單一用途開始,再逐步增加功能。
官方公布的低記憶體數字來自量化模型。量化是降低模型數值的精度,藉此縮小儲存與運算負擔的方式。Google 在 Pixel 11 Pro 上列出的數字是,純文字權重最低約需 191 MB,完整多模態模型約需 567 MB 的作用中記憶體。權重是模型學習完成後儲存下來的參數數值。
這些數字有助於評估模型是否能放進裝置,但應用程式還要處理原始圖片、音訊、搜尋索引與執行時的中間資料。因此,567 MB 不能當成整個產品的記憶體上限,其他手機的速度也要另外量測。測試裝置與數字見 Google 官方公告。
程式碼搜尋進步明顯,中文效果仍要用自己的資料確認
新版也改善了用自然語言找程式碼的能力。開發者記得某段程式負責的功能,卻不知道檔案位置時,可以用描述查找相關內容。這類搜尋能協助工程師理解陌生專案,也能供程式代理取得需要的背景資料。
Google 的模型卡列出,MTEB Code 這組程式碼嵌入測試中,EmbeddingGemma 2 得分為 78.68,前一代為 68.76,增加 9.92 個分數點。這是特定測試下的比較結果,不能直接解讀成每個專案都能省下同樣比例的搜尋時間。

文字能力則較接近前一代。官方多語言文字測試得分從 61.15 變成 61.36,因此這次更新的主要吸引力是加入多模態與改善程式碼搜尋。上述測試使用完整精度模型,與手機量化版本的最低記憶體數字屬於不同測試條件,資料可見 Google 官方模型卡。
官方說明模型支援超過 100 種語言,也提醒不同語言的效果可能不一致。台灣開發者若要處理繁體中文文件、中文錄音或中英混合教材,仍應準備實際搜尋題目,確認相關結果是否出現在前幾名。支援語言數量不能代替繁體中文資料的實際搜尋成績。
8K 輸入與向量壓縮,會影響索引怎麼設計
長文件與錄影需要分段處理。EmbeddingGemma 2 的單次上下文上限為 8,192 個 token。Token 是模型切分輸入時使用的基本單位,文字、圖片與音訊都會占用同一份額度,因此它不等於 8,192 個中文字。
依照模型卡的預設配置,在只有單一媒體、沒有搭配文字時,單次輸入大約可容納 29 張圖片、58 個影片影格,或 327 秒音訊。影片預設每秒抽取一個影格,也能調整取樣頻率與影像處理額度。把文字、影音混在同一份輸入時,各種內容會共享上限,詳見 Google 官方模型卡的輸入限制。
這表示一小時的課程錄影仍需要先切成片段、各自建立向量,再保留時間位置。抽樣太疏可能漏掉短暫畫面,增加抽樣又會提高處理量。部署時應依照想找的內容選擇切分方式,例如一張投影片的出現,與一個快速動作需要不同的時間解析度。
向量本身也會占空間。Google 提供名為 Matryoshka Representation Learning 的設計,讓開發者保留向量前面的部分數值,把輸出從 768 維縮短到 512、256 或 128 維。同樣的數值精度下,128 維只需要原本六分之一的向量資料空間。
搜尋品質會隨縮短程度改變。模型卡的多模態綜合測試中,768 維得分為 59.01,256 維為 56.24,128 維降至 45.65。因此,多模態產品應先量測完整向量與 256 維配置,再決定是否壓縮得更小。六倍節省指的是向量資料部分,完整資料庫還包含索引結構與其他欄位。
哪些產品適合開始試用?
依照官方示範與模型設計,私人媒體搜尋、裝置內文件檢索與本機程式碼搜尋,是最容易找到明確用途的三類產品。它們都需要把使用者的描述對應到已存在的內容,也能受益於離線處理與按需求載入模組。
若要建立會回答問題的私人助理,可以把它放進檢索增強生成,也就是 RAG 的流程。RAG 會先從資料中找出相關內容,再交給生成模型作為回答依據。EmbeddingGemma 2 負責搜尋這一步,Gemma 4 等生成模型則負責組織答案,兩者搭配才形成完整的問答體驗。
截至 2026 年 10 月 7 日,Google 已提供 Hugging Face 官方模型頁與開發者指南,並以 Apache 2.0 授權釋出模型。Google AI Edge Gallery 的兩項搜尋展示也已公布。Android 的 ML Kit 整合則被官方列為接下來幾週提供的項目,採用時要區分已釋出的模型與後續平台整合。
建議先選一小批代表性資料,建立一個能驗收的搜尋任務。例如準備 20 個繁體中文描述,人工標記每題應找到的照片或影片片段,再比較結果、處理時間與記憶體。當它能在目標裝置上穩定找到需要的內容,再擴大資料量,會比只看官方最佳數字更容易判斷是否值得導入。
常見問題
EmbeddingGemma 2 可以直接回答問題嗎?
它輸出用來搜尋與比較內容的向量。要將找到的資料整理成文字回答,需要再搭配生成模型,因此它適合擔任私人助理中的檢索元件。
下載模型後可以離線使用嗎?
官方設計支援在裝置上執行,並展示離線搜尋用途。應用程式仍需先取得模型與要搜尋的資料,整個產品是否離線,也取決於開發者有沒有串接雲端服務。
191 MB 代表所有手機都能順暢執行嗎?
這是官方在 Pixel 11 Pro、量化模型與純文字權重條件下公布的數字。是否順暢還要看手機硬體、資料量、處理格式與完整應用程式的負擔。
可以只用文字搜尋已建立的圖片向量嗎?
可以。各種模組配置共用同一個向量空間,因此文字查詢能比對多模態資料,但查詢與資料端必須使用相同的輸出維度。
結語:先用一個搜尋任務驗證裝置端的價值
EmbeddingGemma 2 提供了一條可實作的路徑,讓開發者在較小的模型中整合文字、圖片與影音搜尋。對需要離線整理私人資料的產品,它值得開始做小規模驗證,官方的照片與影片示範也讓用途更容易理解。
是否採用,應由目標資料的搜尋品質與實際裝置的負擔決定。如果繁體中文描述找不到正確片段,或建索引的時間超過產品能接受的範圍,就需要調整切分方式、向量維度或模型方案。能找到內容、等得起處理、裝置跑得動,才構成這款模型在產品中的價值。