Az Nvidia új, nyílt forráskódú Neotron 3 diarizációs modellje forradalmi újításokat vezet be a beszélőfelismerés területén. Ez a modell képes akár nyolc különböző beszélő beazonosítására egy hangfelvételen, ráadásul valós időben, vagy előre rögzített hanganyagokon is kiválóan teljesít.
Az összefoglaló bemutatja a Neotron 3 telepítését, működését, valamint CPU-n és GPU-n való futtatását is, különböző beállításokkal. Részletesen vizsgálják a modell teljesítményét mind élő, mind offline üzemmódban, valamint azt is, mennyire képes kezelni az átfedő beszédhelyzeteket.
Érdekes összehasonlítás születik arról is, hogyan teljesít a modell más ismert szolgáltatásokkal szemben, mint például a Meta, Assembly AI vagy 11 Labs megoldásai. A bemutató kitér a modell hibalehetőségeire, a beszédszegmensek pontos felismerésére, és arra is, hogy különböző nyelveken képes-e jól dolgozni.
A tesztek során a Neotron 3 többféle, változatos minőségű és nyelvű hangfájlt is feldolgoz, valamint kombinálták a Parakeet modellel, hogy valós használati példákon demonstrálják, miként rendelhető minden kimondott szó mellé pontosan a megszólaló beszélő címkéje.









