Az AMD bemutatta első saját fejlesztésű AI modelljét, amely az Instella-MoE-16B-A3B-Think nevet kapta, és több mint 16 milliárd paraméterrel dolgozik. A mesterséges intelligencia világában ez jelentős lépés a vállalat részéről, főleg úgy, hogy saját hardvereken – az Instinct MI300X és MI325X GPU-kon – történt a tréning, teljesen átlátható és nyílt módon, minden mérési adatot és beállítást publikálva.
Két újszerű fejlesztés áll a modell középpontjában, amelyek főként a figyelemmechanizmusra és a műveleti sebességre fókuszálnak. Az egyik újítás olyan, mintha egy intelligens hangerő-szabályzót illesztenének a figyelem réteg után, ami lehetővé teszi, hogy a modell automatikusan felerősítse a hasznos jeleket, míg a lényegtelen információkat elnémítsa.
A második hozzájárulás a Far Scape névre hallgat, amely a számítási hatékonyságot javítja. A nagy nyelvi modellek esetén gyakori probléma az adatok átadása a GPU-k között, ami időveszteséget okoz. Ez az újítás csendben, a háttérben kezeli a szükséges adatcserét, miközben a GPU-k tovább dolgoznak, így jelentősen csökkentve a várakozási időt és gyorsítva a tanítási folyamatot.
Az eredményeket kizárólag az AMD által publikált mérőszámokon keresztül mutatják be, amelyek többnyire régebbi vagy kevésbé ismert modellekkel történő összehasonlításokat tartalmaznak. Ezek a benchmarkok ugyan nem tűnnek piacrengetőnek, de mindenképpen izgalmas látni, hogy egy új szereplő milyen innovációkkal tör be erre a területre, és milyen témákat vet fel a jövőbeli modellek fejlesztésében.










