Az alkotó egy új, nagy port kavart szöveg-beszéd modellt, a Breeze TTS 2 képességeit veszi górcső alá, nem csupán a reklámhullámokat követve, hanem saját maga tesztelve azt helyileg, Ubuntu rendszeren.
A bemutatóban részletesen kitérnek arra, hogyan lehet a modellt letölteni, telepíteni, majd a Gradio webes felületen keresztül futtatni, miközben az elérhető VRAM-felhasználás is szóba kerül. Felmerülnek érdekes benchmarking kérdések: vajon mennyire képes a modell megfelelni a szöveges leírásnak (role fit), illetve mennyire változatos hangmintákat produkál (voice diversity)?
Izgalmas funkcióként bemutatják, hogy a Breeze TTS 2 képes referenciahang klónozására, de akár leírásból önálló hangdizájn is megadható. Ráadásul a hang irányítására is lehetőség nyílik: módosítható a hang tónusa, tempója és érzelmi kifejezőereje valós időben.
A videó felszínre hozza a mesterséges intelligencia által generált hangminták „AI-os” érzetének kérdését, illetve teszteli, hogy mennyire tudja a modell visszaadni az eredeti hang jellegét, tónusát. Különféle nyelvi példákon keresztül a szoftver többnyelvűségét is próbára teszik, felvetve, hogy mennyire működik valóban angolul, kínaiul, illetve más európai vagy ázsiai nyelveken.
Felvetődik a kérdés: mennyire tudja egy ilyen, helyileg futtatható, nyílt forráskódú szöveg-beszéd rendszer a jövő hangdizájnját forradalmasítani, és hol húzódnak ma a technológia határai?









