Bemutatásra kerül a Qwen-Image 2.1 mesterséges intelligencia képgeneráló modell, amely képes képszerkesztésre, natív átlátszóságra és részletgazdag képkészítésre szöveges utasítások alapján. Az ismert felhasználói felületeken (Comfy UI) keresztül szemléltetik a modellt, miközben technikai beállításokat – például szövegkódolókat, VAE-t és diffúziós modelleket – is érintenek.
Különböző kreatív és technikai feladatokon keresztül tesztelik a modellt: például bonyolult enteriőrök összeállítását különálló bútorokból, valamint egy tradicionális dél-ázsiai paant is generálnak, ahol minden összetevőt a modell készít. Felmerülnek kérdések a modellek kulturális ismeretéről, precizitásáról és rugalmasságáról is.
Földrajzilag sokféle kulturális referenciát mutatnak be, például egyiptomi kalligráfiát, bulgáriai utcarészleteket, cseh hidakat, egészen New York-i neonfeliratokig vagy rwandai tradicionális motívumokat. Mindeközben bemutatják a promptolás hatásait, a generált vizuális minőséget, valamint a szoftver működésének részleteit is.
A mesterséges intelligencia beállításait – mint például a sampler algoritmust, a zaj eltávolítási sebességét (scheduler), valamint a CFG-t – szintén bemutatja a szerző, hogy a felhasználók jobban átláthassák a képgenerálás folyamatait. Az ismeretlen és ritka témák (mint a paan) különös kihívás elé állítják a modellt, felvetve a kérdést: mennyire képes új vagy szokatlan vizuális problémák megoldására?










