A
A
  • Angol
  • Magyar
  • 10 perc

Breeze TTS 2: helyi hangklónozás és hangdizájn valós időben Ubuntu alatt

A videóban a Breeze TTS 2 szöveg-beszéd modellel végzett helyi teszteken keresztül mutatják be, hogyan lehet hangokat klónozni, létrehozni és módosítani, kiemelve a rendszer valós idejű képességeit és sokoldalúságát.

Az alkotó egy új, nagy port kavart szöveg-beszéd modellt, a Breeze TTS 2 képességeit veszi górcső alá, nem csupán a reklámhullámokat követve, hanem saját maga tesztelve azt helyileg, Ubuntu rendszeren.

A bemutatóban részletesen kitérnek arra, hogyan lehet a modellt letölteni, telepíteni, majd a Gradio webes felületen keresztül futtatni, miközben az elérhető VRAM-felhasználás is szóba kerül. Felmerülnek érdekes benchmarking kérdések: vajon mennyire képes a modell megfelelni a szöveges leírásnak (role fit), illetve mennyire változatos hangmintákat produkál (voice diversity)?

Izgalmas funkcióként bemutatják, hogy a Breeze TTS 2 képes referenciahang klónozására, de akár leírásból önálló hangdizájn is megadható. Ráadásul a hang irányítására is lehetőség nyílik: módosítható a hang tónusa, tempója és érzelmi kifejezőereje valós időben.

A videó felszínre hozza a mesterséges intelligencia által generált hangminták „AI-os” érzetének kérdését, illetve teszteli, hogy mennyire tudja a modell visszaadni az eredeti hang jellegét, tónusát. Különféle nyelvi példákon keresztül a szoftver többnyelvűségét is próbára teszik, felvetve, hogy mennyire működik valóban angolul, kínaiul, illetve más európai vagy ázsiai nyelveken.

Felvetődik a kérdés: mennyire tudja egy ilyen, helyileg futtatható, nyílt forráskódú szöveg-beszéd rendszer a jövő hangdizájnját forradalmasítani, és hol húzódnak ma a technológia határai?