Az utóbbi években jelentősen megnőtt a döntéstámogató modellek jelentősége a mesterséges intelligencia fejlődésével párhuzamosan. Az itt ismertetett újdonság, a Clef 27B, a Cloudflare teljesen nyílt forráskódú, multimodális döntési modellje, amely 27 milliárd paramétert tartalmaz. Ez a modell nem egy hagyományos chatbot: szöveget, képet, videót vagy akár JSON-t is képes bemenetként kezelni, majd különböző opciók valószínűségi értékelését adja vissza egyetlen lépésben.
A Clef 27B lényeges újítása, hogy nem generál szöveget, hanem strukturált, gyors döntéseket szolgáltat, ráadásul képes többféle kérdésre valós időben, párhuzamosan válaszolni. A multimodalitás révén a rendszer olyan helyzetekben is jól működik, ahol más modellek nem (például komplex társas szituációk vagy idegen nyelvű tartalmak feldolgozása).
Tesztelés során a modell képes volt felismerni szociális manipulációs kísérleteket, emocionális dinamikákat értelmezni egy képen, összetett fizikai és kémiai diagramokat analizálni, illetve különböző nyelveken (például üzbég) politikai témákat értelmezni. Kiemelt szerepet kap a bemutatóban az, hogy miként teszi lehetővé a különféle multimodális felhasználást, például egy rövid videó jelenetének értelmezését vagy képről származó érzelmi állapot meghatározását.
A Clef teljesítményét más döntési modellekkel (például Jev, Kev, Lia, CLM) együtt vizsgálják, és a különbségekre, valamint a multimodalitásban rejlő egyedi lehetőségekre terelődik a figyelem. Felmerül a kérdés: vajon mennyire közelíthetik meg vagy haladhatják meg ezek a modellek az emberi megértést és ítélőképességet bonyolult vagy érzékeny helyzetekben?








