Az utóbbi időszakban lelassult az open source mesterséges intelligenciák helyi futtatására alkalmas modellek új kiadása. Sokan úgy érzik, mintha az innováció elcsendesedett volna, és egyesek szerint a fejlesztések zárt ajtók mögött folytatódnak, miközben a közösség perifériára szorul.
Mégis, a felszín alatt figyelemre méltó fejlesztések zajlanak. Bemutatják például a Colibri nevű rendszert, amely egy újszerű memóriakezelési és kvantálási megoldással érkezik, lehetővé téve, hogy több modellrészlet hatékonyan elférjen a RAM-ban, miközben meghatározott elemek, mint például a több-tokenes predikciós fej, magasabb precizitást tartanak meg a teljesítmény javítása érdekében.
Egy másik újszerű megközelítés a Bonsai 27B modell, amely rendkívül alacsony bitrátás súlyozással (ternary, azaz -1, 0, +1 értékekkel) dolgozik, így drasztikusan csökkenti a szükséges erőforrásokat – akár iPhone-on is futtathatóvá téve a 27 milliárd paraméteres modellt.
Szóba kerül a Tencent High3 modellje is, amely sokrétű kvantálási stratégiát alkalmaz, a legérzékenyebb részeket magasabb precizitással kezelve, miközben más, kevésbé kritikus komponenseket akár 1 biten is kezel. Ez a megközelítés mutatja, mennyire fontos a részletes, rétegszintű finomhangolás a hatékonyság és a futtathatóság egyensúlya érdekében.
A fejlesztői háttérben megjelenik az Angel Slim kompressziós keretrendszer, amely nemcsak egy-egy modellhez, de széles körben alkalmazható, átfogó kvantálási, mintavételi és tömörítési funkciókkal, nyílt forráskóddal és folyamatos fejlesztéssel bír. A videó során felmerül az is, vajon ki töltheti be a keletkező űrt a kisebb, kevésbé erőforrás-igényes modellek piacán, ha például a Qwen projekt háttérbe szorulna – lehetséges jelöltekként felmerül például a Google vagy kínai cégek.










