A
A
  • Angol
  • Magyar
  • 9 perc

Rekordsebességű AI modell futtatása AMD chipeken, teljesen helyben

Egy 284 milliárd paraméteres AI modell példátlan sebességgel fut egyetlen AMD chipen, teljesen helyben, Python nélkül.

Egy modern mesterséges intelligencia modellt futtatnak teljesen helyben, egyetlen számítógépen, mindenféle külső API vagy felhőszolgáltatás igénybevétele nélkül. A képernyőn egy AMD Ryzen AI Max + 395 processzorra és Radeon 860S GPU-ra specializált rendszer működését mutatják be, amelyen a DeepSeek V4 flash, egy 284 milliárd paraméteres nagy nyelvi modell nyújt impresszív teljesítményt.

Az érdekes technikai témák közé tartozik a speculative decoding, amely lehetővé teszi, hogy a rendszer több szövegrészt dolgozzon fel kevesebb lépésben, növelve ezzel a sebességet, illetve a multi-token heads (MTP), amellyel egyetlen lépésben akár három extra token keletkezik. Mindehhez kizárólag C++-ban írt szoftvert használnak, amely közvetlenül kommunikál az AMD GPU-val, Python keretrendszer nélkül.

Felmerülnek olyan kérdések, mint például hogy pontosan hogyan valósulnak meg a gyorsítási trükkök, milyen előnyöket nyújt a Loose Box nevű saját inference engine, valamint mik a hardveres és szoftveres beállítások, amelyek maximalizálják e modellek helyi futását. Vajon milyen kihívásokat jelent egy ilyen nagy modell helyi futtatása, és mik a kompromisszumok a minőség és a teljesítmény között? Ezekre a témákra koncentrál a bemutató.