Néhány mesterséges intelligencia modell manapság csak minimális mértékben különbözik egymástól, ám most bemutatkozik a Neutrino-8B, amely merész új irányt venni. Ez az új, 8 milliárd paraméteres chatmodell extrém tömörítéssel készült, ám mégsem esik szét, ami technikailag nagy kihívásnak számít.
Az egyik különleges megoldás benne, hogy minden modellbeli súly csak három lehetséges értéket vehet fel: -1, 0 vagy +1. Ezzel jelentősen csökken a szükséges memóriaigény, miközben mégis koherens válaszokat képes generálni. A mintázat ritka pozitív és negatív értékekből áll, a súlyok nagy része pedig teljesen kikapcsolt állapotban van.
Emellett egy sebességnövelő trükköt is alkalmaz: a spekulatív dekódolás technikáját. Ennek lényege, hogy egy kisebb, gyorsabb modell előre kitalálja a következő szavakat, majd a nagyobb modell egyszerre ellenőrzi ezeket, így jelentősen nő a válaszadás gyorsasága anélkül, hogy romlana a minőség.
A videó bemutatja, hogy miként telepíthető és futtatható a modell egy Nvidia RTX 3060 GPU-n, illetve valódi példákon keresztül teszteli, hogyan boldogul fejtörős feladatokkal, valamint egy komplett animált weboldal készítésével is próbára teszi a tömörítési megoldás határait.










