A
A
  • Angol
  • Magyar
  • 9 perc

Qwen Robot Suite: Három új modell az intelligens robotok világában

Három új, egységes alapmodellen keresztül mutatja be a Qwen, miként lehet a robotok mozgását, manipulációját és világmodellezését egyetlen rendszerbe integrálni, új távlatokat nyitva a fizikai világban működő mesterséges intelligencia előtt.

Ez az anyag a Qwen robot suite három alappillérét mutatja be: a navigációs, a manipulációs és a világszimulációs modellt. Az első modell, a RobotNav, a robotok önálló tájékozódását teszi lehetővé ismeretlen terepen, kizárólag kameraképen és szóbeli utasításon alapulva, előzetes térkép vagy kulcsképek nélkül.

Külön figyelmet érdemel a RobotManip, amely több tízezer órányi, nyílt forrású manipulációs adaton és kézi demonstrációkon alapul, ezáltal minimálisra csökkentve az adatvédelmi aggályokat és a zárt tanítási adathalmazokat. Az eszköz képes különféle fizikai interakciók végrehajtására, alkalmazkodva az utasításokhoz és a környezeti változásokhoz.

A harmadik komponens, a RobotWorld, mesterséges intelligencián alapuló videóvilág-modellként működik: képes előre jelezni, hogy egy adott kiinduló helyzet és szöveges utasítás mellett mi történik a környezettel. A rendszer így nemcsak mozgást és manipulációt tud szimulálni, hanem újfajta tréning- és tesztkörnyezetet is kínál a robotikában.

A rendszerek központja a Qwen vision-language modellek családja, amelyek már több alkalmazásban bizonyítottak. A fejlesztők kiemelték a különféle gépi érzékelők fontosságát, és azok súlyozását dinamikusan lehet állítani – így minden feladatnál optimalizálható a robot viselkedése. Felmerül a kérdés, hogyan egyesíthető többféle robotikai feladat egy közös alaprendszerben, és miként teszik lehetővé az ilyen rendszerek a robotok rugalmas, komplex alkalmazását változatos fizikai környezetekben.