Az MI világában egyre több figyelmet kapnak azok a modellek, amelyek nem szöveget generálnak vagy érvelnek, hanem azonnali, megbízható döntéseket hoznak valószínűségi alapon. Ezek közül öt különböző modellt vetnek össze ugyanazzal a problémával és kérdéskörrel ugyanabban a tesztkörnyezetben.
Az elemzés középpontjában az áll, hogy ezek a modellek hogyan reagálnak egy elégedetlen ügyfél problémájára, akit kétszer terheltek meg, és nem éri el az ügyfélszolgálatot. Arra keresik a választ: sürgős-e az eset, melyik részleg foglalkozzon vele, és mennyire dühös az ügyfél?
Érdekes egybevetni, hogy minden modell megfelelően azonosította az érintett részleget, de jelentős különbségek mutatkoztak a sebesség, a bizalom szintje és a frusztráció mértékének felismerése terén. A méret és az architektúra is különbözik; van köztük kisebb paraméterszámú, kifejezetten helyi futtatásra szánt modell, illetve zárt, felhőalapú, fizetős megoldás is.
Az egyik legfontosabb kérdés, hogy ezek a döntési modellek hogyan teljesítenek biztonságkritikus helyzetekben, például amikor valaki gyanús adathozzáférést kér. Itt már komoly különbségek derülnek ki abban, hogy mely modellek képesek kiszűrni a manipulációt, és melyek nem. Ez rávilágít arra, mennyire fontos a tesztelés, mielőtt éles környezetben alkalmaznánk őket, különösen érzékeny feladatoknál.









