A
A
  • Angol
  • Magyar
  • 13 perc

Qwen-Audio 3.0-teszt: Soknyelvű beszédszintézis és stílusvezérlés a gyakorlatban

A videó részletesen bemutatja a Qwen-Audio 3.0 ún. text-to-speech rendszerének képességeit, kiemelve a többnyelvűséget, az instrukciókontrollt és a finomhangolható érzelemcímkéket.

Bemutatásra kerül egy új, professzionális text-to-speech rendszer, amelyet a Tongyi Coqui Audio csapata fejlesztett. A modell több nyelven és különböző stílusokban képes szöveget beszéddé alakítani, kiemelve az utasításvezérlést és az érzelemcímkék használatát.

Az alkotó kiemeli a különböző rivális rendszerekkel való összehasonlítást, miközben rávilágít arra, hogy a modell valós időben vagy magasabb minőségben is futtatható. A tesztek során 16 különféle nyelven próbálják ki a rendszert, minden esetben eltérő tematikájú mondatokkal, hogy minél változatosabb kihívások elé állítsák a szoftvert.

Egy fontos fókuszpont az, hogy nem csupán előre beállított hangstílusokat használnak, hanem részletes instrukciókat adnak a vezérléshez, például „beszélj lassan és szomorúan”, vagy „újságolvasó stílusban”. A minták között szerepelnek esti mesék, munkahelyi viták, vagy akár rádiós bemondók is.

Továbbá bemutatják az inline érzelemcímkék működését, ahol a kívánt érzelmek (pl. nevetés, sóhaj, düh) közvetlenül a szövegbe illeszthetők, és ezek hatására változik a beszéd stílusa a szöveg adott pontján. A kihívás, hogy bár a funkció hivatalosan csak angol és kínai nyelven dokumentált, a tesztelés során minden támogatott nyelven kipróbálják.

Az eredmények között kiemelik, mennyire képes a modell követni az instrukciókat és finomhangolni az előadásmódot a különböző szituációkban és nyelveken. Felmerülnek olyan kérdések, hogy vajon valóban elérhető-e minden funkció a kevésbé támogatott nyelveken, illetve hogy az inline címkék mennyire működnek konzisztensen minden esetben.