Az összehasonlítás fókuszában két eltérő hardvermegoldás áll: egyetlen Mac Studio M5 Ultra és egy két eszközből álló Nvidia DGX Spark klaszter. A videó részletesen bemutatja, hogyan viselkednek ezek a rendszerek nagy nyelvi modellek (LLM-ek) lokális futtatásánál, különösen nagy adatbevitel és több felhasználó esetén.
Felmerül a kérdés: mikor érdemes két önálló gépet használni, és mikor előnyös egy egyben lévő, magas teljesítményű hardvert választani? Különös hangsúlyt kap a memóriakapacitás és az átviteli sebesség, valamint hogy miként befolyásolja ezek egyensúlya a tényleges teljesítményt, főleg olvasási (prompt feldolgozási) és írási (token generálási) lépéseknél.
Többféle szoftveres motorral is tesztelik a környezeteket (MLX, Llama CPP, VLM), hogy kiderüljön, milyen mértékben javítható vagy rontható a sebesség pusztán szoftveres váltásokkal. Szó esik a cache-hatásról is: mekkora jelentősége van az első prompt feldolgozási időnek a későbbi munkamenethez képest.
A teljesítmény mellett olyan gyakorlati szempontok is előkerülnek, mint az energiafogyasztás, a hardverek hőmérséklete és a valós idejű használhatóság különböző felhasználói szám esetén. A nézőt végigkíséri a dilemma: melyik konfiguráció milyen felhasználási profilhoz illik, és mik a kompromisszumok a skálázhatóság, kompatibilitás és kényelem terén.










