Az ARK-ASR-3B egy fejlett, többnyelvű beszédfelismerő modell, amely képes a beszélt hanganyagot szöveggé alakítani. A 3 milliárd paraméterrel rendelkező változat kiemelkedő eredményeket ért el angol nyelvű átírásokban, még a legnehezebb valós tesztek során is.
A videó során helyben telepítik és próbálják ki a modellt egy Ubuntu rendszerű gépen, Nvidia RTX A6000-es GPU-val, 48 GB VRAM-mal felszerelve. A telepítés menete, valamint az eszköz hardverigényei is bemutatásra kerülnek, kitérve arra, hogy kisebb, CPU-n is futtatható verzió is létezik.
Részletesen ismertetik a modell architektúráját, amely három fő elemből áll: egy hangkódolóból, egy MLP adapterből és egy Gwen nyelvi modellből. Ez a felépítés lehetővé teszi az audio-információ hatékony feldolgozását, valamint azt, hogy a nyelvi modell kihasználja a mondatok szerkezetére vonatkozó tudását.
A tesztelés során különböző nyelveken – például angol, arab, német, hindi, spanyol – is kipróbálják az ARK-ASR teljesítményét. Felvetődik a kérdés, hogy mennyire megbízható a transzkripció más nyelveken, illetve hogyan kezeli a modell a nem támogatott nyelveket. A bemutató rávilágít arra is, hogy bár a modell elérhető eredményeket produkál, sebessége és a többnyelvű lefedettsége még fejlesztésre szorul.
A készítő kitér az OPD (Online Policy Distillation) nevű speciális tréningmódszerre is, amely a tanár-diák rendszeren keresztül próbál hatékonyabbá tenni a beszédfelismerő tanulását. Ez mind technológiai, mind gépi tanulási szempontból érdekes kérdéseket vet fel a jövő fejlesztései számára.










