A Kyoai nyílt forráskódú Pocket TTS megoldása jelentős újítást hoz a szövegfelolvasás területére: immár nemcsak telepíthető és kipróbálható CPU-n, de a teljes tanítási folyamat is elérhetővé vált. Ennek révén bárki képes saját TTS modellt készíteni bármilyen nyelven, egyedi hanggal, lokálisan, GPU segítségével.
A videó bemutatja a teljes munkafolyamatot, kezdve a szükséges kódtár letöltésétől és a környezet telepítésétől, egészen az adatelőkészítésig és a futtatásig. Kiemelten foglalkozik a nyers hang- és szövegadatok párosításával, valamint azok feldolgozásával, hogy a modell taníthatóvá váljon. Bemutatásra kerül, milyen fontos szerepet játszik az időbélyegezés és a szóegyeztetés a pontos hangmodellezésben.
Érdekes kérdésként merül fel, hogyan lehet minél jobb minőségű, valósághű beszédszintézist elérni amatőr körülmények között, illetve milyen adatmennyiség és tisztaság szükséges ahhoz, hogy a végeredmény egy jól működő, személyre szabott TTS modell legyen. A néző betekintést kap a tanító és diák modell fogalmába is, és megtudhatja, hogyan tömöríthető egy nagyméretű, nagy erőforrást igénylő modell könnyen futtatható verzióvá.










