Egy kompakt, tenyérben is elférő számítógépen futtat egy 27 milliárd paraméteres mesterségesintelligencia-modellt a szerző. A tesztelés során arra kíváncsi, mennyire teljesít jól egy ekkora LLM egy ilyen kis gépen, amelyet eredetileg nagy GPU-kra terveztek.
A Kadas Mind Pro gép 64 GB memóriával és Intel Panther Lake processzorral, valamint beépített ARC B390 integrált grafikával működik, de létezik hozzá dokkoló is dedikált GPU-val (5060 Ti), ami további teljesítményt kínál. Részletesen bemutatja, milyen módszerekkel lehet gyorsítani a különböző hardveres és szoftveres megoldásokkal, például integrált vagy dedikált GPU használatával, különböző memóriakiosztásokkal, illetve draftmodellek alkalmazásával.
Sorba veszi, milyen memóriabeli és sávszélességi korlátok határozzák meg a teljesítményt, és bemutat különféle trükköket, hogyan lehet optimalizálni a sebességet kvantizációs szintek vagy rétegszétosztások segítségével. Vizsgálja, hol húzódik meg az a pont, ahol a hardveres korlát miatt hirtelen drasztikusan csökken a teljesítmény.
Felmerülnek kérdések a kvantizálás okozta modelminőségi változásokról, szoftveres beállításokról (például a Llama CPP nem minden kapcsolója működik optimálisan), valamint arról is, hogy a gépen belüli és dokkolóval kibővített kapcsolatok (például PCIe sávszélesség) mennyire számítanak valójában a gyakorlati működés során.
Minden tapasztalat, az esetleges hibák, mérésekkel kapcsolatos problémák és váratlan leállások alapján is fontos tanulságokat von le a szerző, amelyek segíthetnek másoknak elkerülni a tipikus csapdákat. Útmutatást ad ahhoz is, hogyan válasszunk megfelelő hardverkonfigurációt, ha ilyen méretű AI modellekkel szeretnénk kísérletezni.










