A frissen megjelent Qwen 3.8 Max modell nyers súlyainak elérhetősége sokakat izgat, de ehhez hasonló hatalmas AI-modell helyi futtatásának akadályai gyorsan felszínre kerülnek. A szerző kiemeli, hogy a nyílt súlyok megszerzése önmagában még nem jelent gyakorlati hozzáférhetőséget.
Az architektúra és hatékonyság részleteibe mélyedve bemutatásra kerül, milyen tervezési döntések, mint például a linearitás és a szelektív figyelemrétegek, teszik lehetővé a hatalmas paraméterszám kezelését. Külön figyelmet kap a memóriaigény drámai növekedése és az, hogyan jutott a közösség kvantálási megoldásokhoz, melyekkel ugyan csökken a helyigény, de még így is szinte elérhetetlen marad a legtöbb felhasználó számára.
A szerző rámutat, milyen különbség van a „nyílt” és a ténylegesen „elérhető” modellek között. Bár üdvözlendő, hogy a fejlett modelleket publikussá teszik, ezek futtatásához jelentős erőforrásokra van szükség. Technikailag részletezi, hogy milyen lehetőségek és eszközök – például VLLM – állnak rendelkezésre, de ezek is több száz gigabájtos GPU-memóriát igényelnek.
A videó érdekes kérdéseket vet fel az AI-modellek demokratizálásáról, a kutatók és fejlesztők szerepéről a nagy modellek csökkentésében, valamint arról, meddig tart ez a folyamat, mire a szélesebb közönség számára is elérhetővé válnak. Végül annak lehetőségét is felveti, hogy a jövőben megjelenő, kisebb modellek hogyan hozhatják közelebb ezt a technológiát mindenkihez.









