A
A
  • Angol
  • Magyar
  • 7 perc

AMD első AI modellje figyelemtechnológiai újításokkal és hatékonyabb számítással

Az AMD egy teljesen új AI modellt mutatott be, amely két izgalmas figyelemtechnológiai és hatékonysági újítást vezet be a mesterséges intelligencia területén.

Az AMD bemutatta első saját fejlesztésű AI modelljét, amely az Instella-MoE-16B-A3B-Think nevet kapta, és több mint 16 milliárd paraméterrel dolgozik. A mesterséges intelligencia világában ez jelentős lépés a vállalat részéről, főleg úgy, hogy saját hardvereken – az Instinct MI300X és MI325X GPU-kon – történt a tréning, teljesen átlátható és nyílt módon, minden mérési adatot és beállítást publikálva.

Két újszerű fejlesztés áll a modell középpontjában, amelyek főként a figyelemmechanizmusra és a műveleti sebességre fókuszálnak. Az egyik újítás olyan, mintha egy intelligens hangerő-szabályzót illesztenének a figyelem réteg után, ami lehetővé teszi, hogy a modell automatikusan felerősítse a hasznos jeleket, míg a lényegtelen információkat elnémítsa.

A második hozzájárulás a Far Scape névre hallgat, amely a számítási hatékonyságot javítja. A nagy nyelvi modellek esetén gyakori probléma az adatok átadása a GPU-k között, ami időveszteséget okoz. Ez az újítás csendben, a háttérben kezeli a szükséges adatcserét, miközben a GPU-k tovább dolgoznak, így jelentősen csökkentve a várakozási időt és gyorsítva a tanítási folyamatot.

Az eredményeket kizárólag az AMD által publikált mérőszámokon keresztül mutatják be, amelyek többnyire régebbi vagy kevésbé ismert modellekkel történő összehasonlításokat tartalmaznak. Ezek a benchmarkok ugyan nem tűnnek piacrengetőnek, de mindenképpen izgalmas látni, hogy egy új szereplő milyen innovációkkal tör be erre a területre, és milyen témákat vet fel a jövőbeli modellek fejlesztésében.