Egy modern mesterséges intelligencia modellt futtatnak teljesen helyben, egyetlen számítógépen, mindenféle külső API vagy felhőszolgáltatás igénybevétele nélkül. A képernyőn egy AMD Ryzen AI Max + 395 processzorra és Radeon 860S GPU-ra specializált rendszer működését mutatják be, amelyen a DeepSeek V4 flash, egy 284 milliárd paraméteres nagy nyelvi modell nyújt impresszív teljesítményt.
Az érdekes technikai témák közé tartozik a speculative decoding, amely lehetővé teszi, hogy a rendszer több szövegrészt dolgozzon fel kevesebb lépésben, növelve ezzel a sebességet, illetve a multi-token heads (MTP), amellyel egyetlen lépésben akár három extra token keletkezik. Mindehhez kizárólag C++-ban írt szoftvert használnak, amely közvetlenül kommunikál az AMD GPU-val, Python keretrendszer nélkül.
Felmerülnek olyan kérdések, mint például hogy pontosan hogyan valósulnak meg a gyorsítási trükkök, milyen előnyöket nyújt a Loose Box nevű saját inference engine, valamint mik a hardveres és szoftveres beállítások, amelyek maximalizálják e modellek helyi futását. Vajon milyen kihívásokat jelent egy ilyen nagy modell helyi futtatása, és mik a kompromisszumok a minőség és a teljesítmény között? Ezekre a témákra koncentrál a bemutató.










