A
A
  • Angol
  • Magyar
  • 12 perc

Mage Flow: helyi képgenerálás kis méretű AI modellekkel

A Mage Flow bemutatja, mire képes egy helyben futtatható, kompakt AI-modell a képgenerálás és szerkesztés terén, számos éles példával és izgalmas kérdésekkel.

A Mage Flow projekt választ ad egy régi AI-s kérdésre: szükségesek-e az óriási, energiafaló modellek a kiváló képalkotáshoz, vagy kisebb rendszerekkel is elérhetők látványos eredmények? Egy mindössze 4 milliárd paraméteres helyi futtatású modellről van szó, amely a szöveges utasításoktól egészen a bonyolult képszerkesztési műveletekig terjedő feladatokat képes megoldani egyetlen GPU-n, szinte pillanatok alatt.

A fejlesztés kulcsa két szorosan együttműködő komponens harmóniája, amelyek együttműködve gondoskodnak a változatos szerkesztési lehetőségekről. Legyen szó háttércseréről, egyes objektumok eltávolításáról, stílusváltásról, szegmentációs maszk készítéséről vagy akár mélységtérkép generálásáról, mindezt egyetlen egységes rendszer végzi, speciális eszközök nélkül.

A tesztek során szóba kerülnek a valósághű fények és anyagok megjelenítésének problémái, a kulturális és földrajzi pontosság kihívásai, valamint a kézzel írt szövegek előállításának nehézségei. Különféle helyszínek és kultúrák szerepelnek a példákban, hogy felmérjék, mennyire képes a rendszer összetett, helyspecifikus jeleneteket autentikusan megalkotni.

Az arcábrázolás és részletgazdagság mellett a lokalizált szerkesztési képességeket is próbára teszik: ruhaszín vagy smink megváltoztatása, tárgyak specifikus módosítása, a fényforrások pontos szerkesztése egyaránt a tesztek részét képezik. Néhány próbánál azonban felfedezhetők pontatlanságok vagy félreértések, amelyek új kérdéseket vetnek fel a mesterséges intelligencia vizuális értelmezéséről.