A
A
Google EmbeddingGemma 2: Multimodal Open Model for on-Device Embeddings

Google EmbeddingGemma 2: Multimodal Open Model for on-Device Embeddings

Lejátszás
  • Angol
  • Magyar
  • 9 perc

Google Gemma 2: Új szintre lép a multimodális keresés

A Google új, nyílt modellt mutatott be, amely szöveget, képet, hangot és videót képes közös jelentéstérben kezelni, lehetőséget adva az eszközön történő hatékony multimodális keresésre.

A mesterséges intelligencia fejlődése tovább gyorsul, ahogy a Google DeepMind bemutatta a Gemma 2 nevű, nyílt forráskódú beágyazó modellt. Ez a rendszer képes szöveg, kód, kép, videó és hang összehasonlítására, mindezt egy közös, 768 dimenziós vektortérben valósítva meg. Így például hangüzenettel kereshetünk videót, vagy szöveges lekérdezéssel találhatunk hangfájlokat egyetlen modell segítségével.

Az új modell megoldást kínál az eszközön történő futtatásra is: moduláris felépítése révén csak a szükséges részegységeket tölti be, így a memóriahasználat is könnyen szabályozható. A modell támogatja a Matrioska-trunkálást, amellyel lényegesen csökkenthető a vektorok tárhelyigénye anélkül, hogy jelentősen romlana a keresések minősége.

A bemutató során különböző tesztek mutatják be a rendszer működését – szövegek jelentés szerinti hasonlóságát, képek és leírások párosítását, valamint a különböző modalitások közötti keresés lehetőségeit. Felmerülnek olyan érdekes technikai kérdések is, mint például: hogyan befolyásolja a vektorméret csökkentése a keresési eredményeket, vagy mennyire skálázható a modell VRAM-felhasználása különböző konfigurációkon?

Izgalmas lehetőségeket vet fel az, hogy a szöveg, a látvány és a hang egy közös jelentéstérben kezelhető. A moduláris szerkezet, az eszközön történő lokális futtatás és a nyílt licenc szintén fontos témák a bemutatóban.