A
A
  • Angol
  • Magyar
  • 9 perc

Nvidia Neotron 3: Új korszak a beszélőfelismerésben

Az Nvidia Neotron 3 új diarizációs modelljének telepítését, helyi tesztelését és teljesítményét mutatja be a videó különböző felhasználási szempontok alapján.

Az Nvidia új, nyílt forráskódú Neotron 3 diarizációs modellje forradalmi újításokat vezet be a beszélőfelismerés területén. Ez a modell képes akár nyolc különböző beszélő beazonosítására egy hangfelvételen, ráadásul valós időben, vagy előre rögzített hanganyagokon is kiválóan teljesít.

Az összefoglaló bemutatja a Neotron 3 telepítését, működését, valamint CPU-n és GPU-n való futtatását is, különböző beállításokkal. Részletesen vizsgálják a modell teljesítményét mind élő, mind offline üzemmódban, valamint azt is, mennyire képes kezelni az átfedő beszédhelyzeteket.

Érdekes összehasonlítás születik arról is, hogyan teljesít a modell más ismert szolgáltatásokkal szemben, mint például a Meta, Assembly AI vagy 11 Labs megoldásai. A bemutató kitér a modell hibalehetőségeire, a beszédszegmensek pontos felismerésére, és arra is, hogy különböző nyelveken képes-e jól dolgozni.

A tesztek során a Neotron 3 többféle, változatos minőségű és nyelvű hangfájlt is feldolgoz, valamint kombinálták a Parakeet modellel, hogy valós használati példákon demonstrálják, miként rendelhető minden kimondott szó mellé pontosan a megszólaló beszélő címkéje.