Google DeepMind 推出 EmbeddingGemma 2 開放模型,文字、影像、影片與語音可轉為同一向量

Google DeepMind 推出 EmbeddingGemma 2 開放模型,文字、影像、影片與語音可轉為同一向量

有助於理解文章的圖片

Google DeepMind 公開新一代多模態嵌入模型

Google DeepMind 於當地時間2026年10月6日公開 EmbeddingGemma 2,這是一款可將文字、影像、影片與語音轉換為同一類型嵌入向量的開放模型。Google表示,這款模型從設計初期便支援多模態處理,是同級開放嵌入模型中的先進方案之一。

EmbeddingGemma 2的完整多模態模型參數規模為7.4億個(740M),模型權重已透過 Hugging Face 與 Kaggle 以 Apache 2.0 授權免費提供。由於該授權允許商業使用,開發者可將模型應用於相關產品開發。模型識別名稱為 google/embeddinggemma-2,Google也表示,未來將提供於 Gemini Enterprise Agent Platform 的 Model Garden,並支援 vLLM、llama.cpp、Ollama 等執行工具。

模型可在裝置端運行,降低雲端依賴

EmbeddingGemma 2的多模態版本由多個部分組成,包括270M規模的文字骨幹模型、170M規模的視覺編碼器,以及300M規模的音訊編碼器。另外,Google也提供僅處理文字的270M版本。

該模型支援8K token上下文長度,輸出向量維度為768維,並採用 Matryoshka(套娃式)訓練方式,可將向量縮減至512、256或128維,以降低運算需求。

Google公布量化後在 Google Pixel 11 Pro 上的記憶體使用量,僅處理文字時約需191MB,完整啟用多模態功能時約需567MB。Google也推出可利用740M規模 EmbeddingGemma 2在本機運作的Mac會議紀錄應用程式,讓使用者可在不連接網路的情況下整理不同應用程式產生的會議紀錄,以及面對面會議內容。

Google公布效能比較,但主要以前代模型為基準

Google公開的測試數據主要與前一代 EmbeddingGemma 1 比較。在MTEB Code(NDCG@10)測試中,EmbeddingGemma 2取得78.68分,高於EmbeddingGemma 1的68.76分,提升9.92分。

不過,在評估多語言文字能力的MTEB multilingual Mean(Task)項目中,EmbeddingGemma 2為61.36分,與前代61.15分相比差距不大。Google另外公布768維設定下的多模態測試結果,包括影像領域MIEB(lite) Mean(TaskType) 64.64分、影片領域MMEB v2 Video Hit@1 50.67分,以及語音搜尋領域MSEB Retrieval MRR@10 69.54分。

Google指出,這款模型在參數量低於10億的多模態嵌入模型中展現優異結果。不過,目前Google官方資料中的比較主要集中於EmbeddingGemma 1,未列出其他公司模型的完整對照表。

Google提醒模型壓縮與使用仍有限制

Google表示,將向量壓縮至128維時,模型品質可能下降。根據開發者指南,文字與程式碼任務在128維時約可維持原始品質的90%,但影像、影片與語音搜尋品質可能降至約75%。Google建議,若要在多模態搜尋場景使用128維設定,部署前應先以實際資料進行驗證。

Google說明,256維設定則可維持接近原始品質。此外,模型卡也列出其他限制,例如音訊單次處理時間約限制在5.5分鐘內;文字任務若未使用建議的工作前綴,可能影響嵌入品質;運算精度建議避免使用float16,而採用bfloat16或float32。

Google同時提醒,雖然模型支援超過100種語言,但不代表所有語言表現完全一致。由大量真實資料訓練的模型,也可能反映資料中的社會與文化偏見。

Source: Original Korean article - Trendy News Korea

留言