Ebben a bemutatóban egy új, ügynöki képességekkel rendelkező nyelvi modellt, a Nex-N2.5 Mini-t vizsgálják meg alaposan. A modell a Next AGI fejlesztése, és a hosszabb távú, önálló feladatvégzésre képes rendszerek közé tartozik: képes számítógépes feladatokat ellátni, böngészni, és saját munkáját vizuális visszacsatolás alapján önállóan javítani.
A tesztelés során a szerző egy felhőalapú GPU-szolgáltatás, a Runpod segítségével állítja be és indítja el a modellt, kihasználva a nagy rugalmasságot, amelyet a modern felhőalapú infrastruktúra kínál — például sablonok vagy egyéni Docker konténerek használatával.
Különös figyelmet fordítanak arra, hogy mennyire képes a modell egyszerre történelmi és kitalált elemeket kezelni, valamint arra, hogyan teljesít összetett multimodális és többnyelvű feladatokban. Több teszten keresztül értékelik a gyorsaságát, a következetességét, illetve azt is, hogyan teljesít a hasonló modellekhez képest, mint például a Claude Opus 5 vagy a Gemini K3 vezető modellekhez mérve.
Az egyik izgalmas részben egy interaktív HTML-szimuláció készítésén keresztül vizsgálják a kódolási képességeit, egy másikban pedig egy közel 80 nyelvet felölelő fordítási feladaton keresztül mutatják be, milyen mélyen érti a regionális nyelvi árnyalatokat. További próbatétel a modell multimodalitását is teszteli egy AI-generált kép alapján, ahol narratív döntést kell hoznia.
Sorra kerülnek kérdések a felhasználhatóságról, a sebességről, a valós értelmezési és önkorrekciós képességekről is — mindezek segítenek feltárni azokat a területeket, ahol a Nex-N2.5 Mini különösen ígéretesnek tűnik, illetve ahol még van tér a fejlődésre.










