A
A
  • Angol
  • Magyar
  • 11 perc

Új korszak a multimodális AI-ban: a Link-3 Flash modell bemutatója

Az Inclusion AI újdonsága, a Link-3 Flash modell kiemelkedő képi és nyelvi teljesítményt mutat: összetett teszteken magabiztosan értelmez képeket, szöveget, humort és tudományos feladatokat is.

Az Inclusion AI új fejlesztésű Link-3 Flash modelljét mutatja be a videó, amely natív multimodális képességekkel rendelkezik. Nem egy szimpla nyelvi modellről van szó, amelyhez utólag csatoltak képfelismerést, hanem alapból erre tervezett rendszerről. A paraméterek menedzselésében különös sajátosság, hogy a 124 milliárd lehetséges paraméterből mindig csak 5,5 milliárd aktiválódik mátrixonként, ami az úgynevezett mixture-of-experts megközelítésnek köszönhetően jelentős hatékonyságot eredményez.

Érdekesség, hogy az architektúra mélyen integrálja a vizuális információkat az értelmezési, tervezési és önellenőrzési folyamatokba. A bemutató során az alkotó több tesztet is lefuttat: például HTML animációs feladatoknál a modell 3D szerkezet, világítás és mozgás szintjén értelmez egy doner kebab forgó nyársat ábrázoló képet, majd HTML formátumban szimulációt generál belőle.

Az egyik valódi kihívás a nyelvi humorok és többértelmű jelentések felismerése volt: a modellnek egy WhatsApp-beszélgetés alapján kellett felismernie, hogy a „hanging” szónak több jelentése lehet, és megbecsülnie a vezető értelmező képességét. Egy másik tesztben a soknyelvűség állt fókuszban, ahol a modell több mint 80 nyelvre, köztük ritkákra is lefordít egy mondatot, figyelembe véve a helyes írásjeleket és diakritikus jeleket is.

Végül egy tudományos, kémiai példafeladaton keresztül elemzik a modell matematikai-okfejtési készségeit, amely során grafikon olvasás, számítás és magyarázat együttesét vizsgálják, illetve azt is, hogy képes-e önállóan felismerni és javítani a saját hibáit programfutás közben. Külön kiemelik, hogy a modell architektúrája a Kimmy nevű korábbi fejlesztésekre épül, főként a Kimmy delta attention rétegeit használva.