A
A
  • Angol
  • Magyar
  • 5 perc

Új AI-módszer kihívás elé állítja a Chat GPT fejlesztési irányát: az RLCD kontra RLHF vita

Dio Almeida, a Chat GPT egyik technikai fejlesztője új AI-módszert mutat be, amely alapjaiban változtathatja meg, hogyan tanítunk modelleket: RLCD, avagy megerősítéses tanulás kalibrált döntésekre.

A Chat GPT forradalmasította a mesterséges intelligencia jelenlegi megközelítését, de felmerül a kérdés: valóban jó az az út, amelyre rátértünk? Egy, a Chat GPT mögötti technikák kifejlesztésében részt vevő szakember, Dio Almeida most megkérdőjelezi a jelenleg széles körben alkalmazott RLHF (Reinforcement Learning from Human Feedback) alapú modelleket.

Almeida szerint a hagyományos, emberi visszajelzésekre épülő modellépítés számos torzítást vezet be, például túlzott magabiztosságot és kisebb megbízhatóságot. Ehelyett új módszert fejlesztett ki Typesafe nevű cégével: az RLCD-t, amely kalibrált döntéseken alapuló megerősítéses tanulást alkalmaz.

Az új megközelítés lényege, hogy a rendszer már nem emberi ítélethez igazodik, hanem ténylegesen a helyes döntésekre, azok valószínűségi értékelésével. Ez komoly eltérést hoz a klasszikus beszélgető algoritmusokhoz képest, és jelentősen gyorsabb, olcsóbb döntéshozatalt ígér.

Pillanatnyilag azonban kérdés, hogy az RLCD ténylegesen meghaladja-e az RLHF módszertant, vagy épp ellenkezőleg: a korábbi megközelítés hibái valójában előnyök speciális felhasználási helyzetekben? A videó alaposan bemutatja mindkét oldal kulcspontjait, továbbá összegzi a Typesafe által közölt, de még függetlenül nem igazolt benchmarkokat is.