A
A
d1-omni-600M Locally: A Decision Model for Audio, Vision, and Text

d1-omni-600M Locally: A Decision Model for Audio, Vision, and Text

Lejátszás
  • Angol
  • Magyar
  • 9 perc

Új hang- és képfelismerő modell: A Liquid AI D1 Omni 600M bemutatkozik

A Liquid AI új, D1 Omni 600M nevű döntési modellje háromféle bemenet – hang, kép, szöveg – feldolgozására képes, és valószínűségekkel válaszol a felhasználói kérdésekre.

Az utóbbi időben egyre több döntési modell jelenik meg, amelyek sokszor hasonlóak egymáshoz, és napi szinten szinte elárasztják a piacot. Ebben a felvételben a D1 Omni 600M döntési modell kerül a középpontba, amely a Liquid AI fejlesztése, és egyedülálló módon hangalapú bemenettel is bővült.

Bemutatásra kerül a modell architektúrája: a 587 millió paraméteres rendszer háromféle modalitást, vagyis szöveget, képet és hangot tud értelmezni, mindezt egy közös „trunk”-on keresztül. Külön érdekesség, hogy a válaszokat nem generált szövegként, hanem valószínűségi értékek formájában adja meg.

Gyakorlati példákon keresztül vizsgálható, hogyan teljesít a modell különböző feladatokon: képalapú elemzéseknél, például stresszhelyzetben lévő személyek felismerése; szövegértésnél ügyfélszolgálati kérdések besorolása; és hangfelvételeknél 13 különféle nyelven próbál válaszokat adni különböző kategóriák szerint.

Felmerülnek olyan izgalmas kérdések, hogy a modell valóban képes-e felismerni a beszéd tartalmát, vagy inkább csak a felszínes nyelvi elemeket ragadja meg. Vizsgálat alá kerül az is, hogy mennyire használható valódi jelentések azonosítására, illetve mik a legnagyobb erősségei és hiányosságai a különböző modalitásokban. A videó több teszthelyzetben hasonlítja össze a teljesítményt, és elgondolkodtat, vajon a kisebb méretű modell valóban hasznos alternatíva lehet-e az edge eszközökön történő használatra.