Az utóbbi időben egyre több döntési modell jelenik meg, amelyek sokszor hasonlóak egymáshoz, és napi szinten szinte elárasztják a piacot. Ebben a felvételben a D1 Omni 600M döntési modell kerül a középpontba, amely a Liquid AI fejlesztése, és egyedülálló módon hangalapú bemenettel is bővült.
Bemutatásra kerül a modell architektúrája: a 587 millió paraméteres rendszer háromféle modalitást, vagyis szöveget, képet és hangot tud értelmezni, mindezt egy közös „trunk”-on keresztül. Külön érdekesség, hogy a válaszokat nem generált szövegként, hanem valószínűségi értékek formájában adja meg.
Gyakorlati példákon keresztül vizsgálható, hogyan teljesít a modell különböző feladatokon: képalapú elemzéseknél, például stresszhelyzetben lévő személyek felismerése; szövegértésnél ügyfélszolgálati kérdések besorolása; és hangfelvételeknél 13 különféle nyelven próbál válaszokat adni különböző kategóriák szerint.
Felmerülnek olyan izgalmas kérdések, hogy a modell valóban képes-e felismerni a beszéd tartalmát, vagy inkább csak a felszínes nyelvi elemeket ragadja meg. Vizsgálat alá kerül az is, hogy mennyire használható valódi jelentések azonosítására, illetve mik a legnagyobb erősségei és hiányosságai a különböző modalitásokban. A videó több teszthelyzetben hasonlítja össze a teljesítményt, és elgondolkodtat, vajon a kisebb méretű modell valóban hasznos alternatíva lehet-e az edge eszközökön történő használatra.







