Bemutatásra kerül egy új, professzionális text-to-speech rendszer, amelyet a Tongyi Coqui Audio csapata fejlesztett. A modell több nyelven és különböző stílusokban képes szöveget beszéddé alakítani, kiemelve az utasításvezérlést és az érzelemcímkék használatát.
Az alkotó kiemeli a különböző rivális rendszerekkel való összehasonlítást, miközben rávilágít arra, hogy a modell valós időben vagy magasabb minőségben is futtatható. A tesztek során 16 különféle nyelven próbálják ki a rendszert, minden esetben eltérő tematikájú mondatokkal, hogy minél változatosabb kihívások elé állítsák a szoftvert.
Egy fontos fókuszpont az, hogy nem csupán előre beállított hangstílusokat használnak, hanem részletes instrukciókat adnak a vezérléshez, például „beszélj lassan és szomorúan”, vagy „újságolvasó stílusban”. A minták között szerepelnek esti mesék, munkahelyi viták, vagy akár rádiós bemondók is.
Továbbá bemutatják az inline érzelemcímkék működését, ahol a kívánt érzelmek (pl. nevetés, sóhaj, düh) közvetlenül a szövegbe illeszthetők, és ezek hatására változik a beszéd stílusa a szöveg adott pontján. A kihívás, hogy bár a funkció hivatalosan csak angol és kínai nyelven dokumentált, a tesztelés során minden támogatott nyelven kipróbálják.
Az eredmények között kiemelik, mennyire képes a modell követni az instrukciókat és finomhangolni az előadásmódot a különböző szituációkban és nyelveken. Felmerülnek olyan kérdések, hogy vajon valóban elérhető-e minden funkció a kevésbé támogatott nyelveken, illetve hogy az inline címkék mennyire működnek konzisztensen minden esetben.










