Két csúcstechnológiás nyelvi modell, a GLM 5.3 Flash és a Qwen 3.8 Flash képességeit ismerhetjük meg részletesen ebben az összehasonlító videóban. Mindkettő hatalmas paraméterszámmal és hasonló felépítéssel büszkélkedhet – izgalmas kérdés, hogyan állnak helyt valódi feladatokban.
A videóban először egy komplex alkalmazás, a NutriGard valós hibájával szembesülnek a modellek: egy logikai hibát kell megtalálniuk és javítaniuk, mindezt minimális instrukcióval. Külön érdekesség, melyikük hogyan dolgozik, mennyi idő alatt készül el, és milyen alaposan ellenőrzik a javítás eredményét.
További próbák során kreatív feladatokat kapnak az ügynökök: például egy AI-generált képet kell HTML-ben újraalkotni 3D animációval, vagy 84 nyelven kell kulturálisan hiteles ismerkedős szöveget írniuk egy fiktív szituációban. Ezeknél a kihívásoknál még érzékelhetőbbek lesznek a modellek közötti különbségek.
Az összehasonlítás során érdekes technikai részletek is feltárulnak: milyen belső architektúrát használnak a modellek, hol térnek el egymástól, mik a gyengeségeik vagy erősségeik ritka nyelvek kezelése vagy az output minőség terén. Vajon mennyire képesek leutánozni az emberi kreativitást, vagy pontosan magukévá tenni a kulturális különbségeket?








