A Google március 10-én mutatta be a Gemini Embedding 2-t, az első natívan multimodális embedding modelljét, amely szövegeket, képeket, videókat, hangfelvételeket és dokumentumokat képes egyetlen egységes vektortérbe mappelni. A modell Public Preview státuszban érhető el a Gemini API-n és a Vertex AI-n keresztül, és jelentős teljesítménybeli ugrást jelent az eddigi szöveges embedding megoldásokhoz képest.
Mi az az embedding, és miért számít?
Az embedding modellek nem szöveget generálnak – ehelyett az adatokat (szöveg, kép, hang stb.) sűrű numerikus vektorokká (számsorokká) alakítják, amelyek a szemantikai jelentést kódolják. Ezek a vektorok kulcsfontosságúak a RAG (Retrieval-Augmented Generation) rendszerekben, a szemantikai keresésben, az ajánlórendszerekben és az adatklaszterezésben. Az eddigi megoldások jellemzően külön modelleket igényeltek különböző médiatípusokhoz.
Egy modell, minden modalitás
A Gemini Embedding 2 legnagyobb újítása, hogy natívan, egyetlen modellarchitektúrán belül kezeli az összes modalitást – nem utólagos illesztéssel. Egy API-hívással lehet szöveget (max. 8192 token), képet (legfeljebb 6 db PNG/JPEG), videót (max. 120 másodperc, MP4/MOV), hangot és PDF dokumentumot (max. 6 oldal) feldolgozni, akár egyszerre, vegyes formában is. A modell 3072 dimenziós vektorokat állít elő, és a Matryoshka Representation Learning (MRL) technikának köszönhetően a dimenzió csökkenthető minőségromlás nélkül a tárolási és számítási hatékonyság érdekében.
br>
Teljesítmény és üzleti előnyök
A Google adatai szerint a modell felülmúlja az iparág vezető megoldásait szöveg-, kép- és videófeladatokban egyaránt. Egyes vállalati partnerek akár 70%-os késleltetés-csökkentést is tapasztaltak. A modell 100+ nyelvet támogat, és integrálható a LangChain, LlamaIndex, Haystack, Weaviate, QDrant és ChromaDB keretrendszerekkel. Két verzióban érhető el: gemini-embedding-2-flash (általános célú) és gemini-embedding-2-flash-001 (rögzített, reprodukálható kimenetekhez).
Forrás: Google Blog, VentureBeat