A Microsoft kutatócsoportjának legújabb fejlesztését, a Fara1.5 27B nevű gépi ügynököt tekinthetjük meg ebben a bemutatóban, amely a korábbi változatokhoz képest jelentős fejlesztésekkel bír. Az ügynök képes egy böngészőt emberi módon irányítani: képernyőképek elemzésével, kattintásokkal, gépeléssel és görgetéssel, anélkül, hogy a HTML DOM-ot vagy bármilyen hozzáférési fát használná – kizárólag vizuális alapon működik.
Érdekes vetület, hogy a modell méretének növekedésével – 4 milliárdtól egészen 27 milliárd paraméterig – látványosan javul a teljesítménye, sőt, a 27 milliárdos változat nyílt forráskóddal is túlteljesíti a piacvezető zárt modelleket. Felvetődik a kérdés: mi lehet az oka ennek a kiemelkedő eredménynek? Hogyan tanulhat hosszabb folyamatokat egy olyan modell, amely csak a legutóbbi három lépés képernyőképét látja?
Praktikus szemszögből Fahad Mirza a telepítés lépéseit demonstrálja Ubuntu rendszeren, egy Nvidia H100 GPU-val, bemutatva az eljárást Conda környezetben, VLLM keretrendszerrel és Playwright-tal. Lehetőség nyílik arra is, hogy a modellt saját alkalmazásba integráljuk, például valós idejű forgalmi jelentések lekérdezéséhez egy Flask applikáción keresztül.
Bepillantást nyerünk a modell működésébe valós példákon keresztül: Wikipedia oldalait böngészi információkért, YouTube-csatornák legnépszerűbb videóit keresi meg, vagy épp élő forgalmi adatokat gyűjt Sydney közúti hálózatáról. Izgalmas kérdésként merül fel, hogy miként képes a rendszer ilyen összetett böngészési feladatokat kontextusban tartani és feldolgozni, valamint mennyire lehet transzparensen auditálni minden egyes műveletet.










