Az elmúlt években meglepő áttöréseket láthattunk a kódoló ügynökök általánosíthatóságában, amelyek már a robotikai irányítás területére is átterjedtek. Kutatók, startupok és jelentős egyetemi szereplők – köztük az MIT professzora, Philip Isola – szerint egy új korszak kezdődhet, ahol nagy nyelvi modellek (LLM-ek) általános célú robotvezérlésre alkalmas „robothasználó ügynökökké” válhatnak.
A beszélgetés során két élvonalbeli technológiákkal foglalkozó startup – Wadd Labs és Robocurve – alapítói mutatják be, hogyan fejlesztenek és tesztelnek olyan LLM-eket, amelyek bonyolult fizikai feladatok végrehajtására képesek robotok irányításával. Bemutatják, hogyan lehet az LLM-eket hatékonyan összekapcsolni robotikai hardverrel, milyen adatgyűjtési és tanítási stratégiákat alkalmaznak, valamint ismertetik a legfrissebb tudományos eredményeket, például a „code-as-policy” szemléletet, amelynek keretében a modellek által generált programkódok határozzák meg a robotok viselkedését.
A videó betekintést nyújt a különböző tanulási megközelítésekbe, például az in-context learning vagy a többlépcsős, önreflektáló tanulás szerepébe, valamint szóba kerülnek a gyorsuló fejlesztési trendek – például az LLM-ek válaszidejének radikális javulása. Különösen izgalmas kérdéseket vet fel az, hogy a számítógépes használati adatok (pl. CAD, Blender) hogyan segíthetik a modelleket a fizikai térbeli gondolkodás fejlesztésében, illetve hogy az általánosabb mesterséges intelligencia milyen módon válhat a jövőben mindenki számára hozzáférhető és hasznos robotikai ügynökké.
Elméleti síkon a beszélgetés érinti a platóni reprezentációs hipotézist is, miszerint a nagy modellek a világ konzisztens leképezésére törekednek, valamint felvillantják, hogy a következő években akár általános célú, természetes nyelvi utasításokra reagáló robotok is elterjedhetnek.










