A Chat GPT forradalmasította a mesterséges intelligencia jelenlegi megközelítését, de felmerül a kérdés: valóban jó az az út, amelyre rátértünk? Egy, a Chat GPT mögötti technikák kifejlesztésében részt vevő szakember, Dio Almeida most megkérdőjelezi a jelenleg széles körben alkalmazott RLHF (Reinforcement Learning from Human Feedback) alapú modelleket.
Almeida szerint a hagyományos, emberi visszajelzésekre épülő modellépítés számos torzítást vezet be, például túlzott magabiztosságot és kisebb megbízhatóságot. Ehelyett új módszert fejlesztett ki Typesafe nevű cégével: az RLCD-t, amely kalibrált döntéseken alapuló megerősítéses tanulást alkalmaz.
Az új megközelítés lényege, hogy a rendszer már nem emberi ítélethez igazodik, hanem ténylegesen a helyes döntésekre, azok valószínűségi értékelésével. Ez komoly eltérést hoz a klasszikus beszélgető algoritmusokhoz képest, és jelentősen gyorsabb, olcsóbb döntéshozatalt ígér.
Pillanatnyilag azonban kérdés, hogy az RLCD ténylegesen meghaladja-e az RLHF módszertant, vagy épp ellenkezőleg: a korábbi megközelítés hibái valójában előnyök speciális felhasználási helyzetekben? A videó alaposan bemutatja mindkét oldal kulcspontjait, továbbá összegzi a Typesafe által közölt, de még függetlenül nem igazolt benchmarkokat is.









