A
A
  • Angol
  • Magyar
  • 9 perc

Neutrino-8B: új szintre emelt tömörítés és gyorsítás egy GPU-n

A Neutrino-8B modell extrém tömörítését és sebességnövelő trükkjeit tesztelik egyetlen GPU-n, hogy kiderüljön, megállja-e a helyét valós feladatokban.

Néhány mesterséges intelligencia modell manapság csak minimális mértékben különbözik egymástól, ám most bemutatkozik a Neutrino-8B, amely merész új irányt venni. Ez az új, 8 milliárd paraméteres chatmodell extrém tömörítéssel készült, ám mégsem esik szét, ami technikailag nagy kihívásnak számít.

Az egyik különleges megoldás benne, hogy minden modellbeli súly csak három lehetséges értéket vehet fel: -1, 0 vagy +1. Ezzel jelentősen csökken a szükséges memóriaigény, miközben mégis koherens válaszokat képes generálni. A mintázat ritka pozitív és negatív értékekből áll, a súlyok nagy része pedig teljesen kikapcsolt állapotban van.

Emellett egy sebességnövelő trükköt is alkalmaz: a spekulatív dekódolás technikáját. Ennek lényege, hogy egy kisebb, gyorsabb modell előre kitalálja a következő szavakat, majd a nagyobb modell egyszerre ellenőrzi ezeket, így jelentősen nő a válaszadás gyorsasága anélkül, hogy romlana a minőség.

A videó bemutatja, hogy miként telepíthető és futtatható a modell egy Nvidia RTX 3060 GPU-n, illetve valódi példákon keresztül teszteli, hogyan boldogul fejtörős feladatokkal, valamint egy komplett animált weboldal készítésével is próbára teszi a tömörítési megoldás határait.