Ugrás a fő tartalomra
← Vissza a hírekhez
AI Models

EmbeddingGemma 2: Nyílt multimodális beágyazó modell

A Google DeepMind kiadta az EmbeddingGemma 2‑t, egy 740 M paraméteres nyílt modellt, amely szöveget, kódot, képeket, videót és hangot ágyaz be az eszközön.

Közzétéve: 2026. október 6.Szerző GetAISet Editorial
Forrás: Google DeepMindEredeti cikk megtekintése →

Az eredeti forrás közzétételi dátuma: 2026. október 6.

Az EmbeddingGemma 2 a legújabb nyílt modell a Google DeepMind‑tól, a Gemma 4 architektúrára épül, és Apache 2.0 licenc alatt került kiadásra. 740 millió paraméterrel natív multimodális beágyazásokat támogat szöveg, kód, kép, videó és hang esetén, és könnyűsúlyú megoldásként pozícionálják az eszközön belüli következtetéshez.

A modell vezető pontszámokat ér el az 1 milliárd alatti multimodális beágyazók között a MTEB Code és MAEB benchmarkokon, és szöveg, látás és hang feladatokban megegyezik vagy felülmúlja a nagyobb modelleket. Moduláris – a csak szöveges feladatok akár 270 M paraméterrel is futtathatók, míg a opcionális látás (170 M) és hang (300 M) enkóderek teljes multimodális támogatást biztosítanak. A Matryoshka Representation Learning lehetővé teszi a fejlesztőknek, hogy a vektorokat 768‑ról 128 dimenzióra rövidítsék, akár 6‑szoros tárhelycsökkentést nyújtva. Kvantált következtetés egy Google Pixel 11 Pro készüléken körülbelül 191 MB RAM-ot használ csak szöveg esetén, és 567 MB-ot a teljes modellhez, valamint egy 8 K token ablak lehetővé teszi akár 5,5 perc hang, 29 kép vagy 58 videókeret feldolgozását.

Az EmbeddingGemma 2 az eszközön belüli szemantikus keresésre, útválasztásra és visszakeresésre készült, megőrizve az adatvédelmet és csökkentve a késleltetést. Párosítható a Gemma 4‑gyel az eszközön belüli retrieval‑augmented generation csővezetékekhez. A modell súlyai elérhetők a Hugging Face‑en és a Kaggle‑en, a telepítési lehetőségek között szerepel a Google AI Edge MediaPipe, a LiteRT, a transformers.js, a WebGPU és különféle kiszolgáló könyvtárak.