Három vadonatúj mesterséges intelligencia modellt – Qwen 3.8 Max, DeepSeek V4 Flash és Kimi K3 – tesztelnek három komplex kihívásban. Ezek a modellek mind modern fejlesztések, amelyek különféle méretű, nyílt vagy zárt súlyokat használnak, és eltérő módon közelítik meg a problémákat. A Qwen az Alibaba zászlóshajója, a DeepSeek a költséghatékonyságáról ismert, míg a Kimi K3 a legnagyobb és egyben jelenleg az egyetlen nyílt súlyú modell.
Az első próba egy valós hibás alkalmazás (tengerparti kabinok foglalását kezelő rendszer) helyreállítása, mely során a modelleknek több rejtett hibát kell megtalálniuk és javítaniuk, a frontendtől a backendig. Fontos kérdés, hogy melyik modell milyen hatékonysággal, mennyi idő és token felhasználásával oldja meg a problémát, valamint hogyan ellenőrzi saját megoldását: elegendő-e a javítás ténye, vagy szükség van alapos visszacsatolásra és automatizált tesztekre?
A második kihívásban a kreativitásukat és technikai tudásukat tesztelik: mindhárom modellnek ugyanazon leírás alapján kell megalkotnia egy 3D-s olajfúrótorony-landing page-et, önálló HTML-fájlként. Itt kiderül, hogy a modellek mennyire tudják vizuálisan és matematikailag értelmezni a feladatot, hogyan használják a 3D-s könyvtárakat (mint például a 3.js), illetve milyen dizájn, részletesség és felhasználói élmény születik a leírásból.
A videó végigvezeti a nézőt az egyes modellek folyamatain, kiemelve az eltérő stratégiákat és eredményeket. Felmerülnek olyan kérdések, hogy milyen speciális előnyökkel vagy hiányosságokkal rendelkeznek ezek a modern AI modellek, továbbá mennyire megbízhatóak nagy kihívások vagy akár kreatív feladatok esetén.










