A videóban egy újszerű, mesterséges intelligencia-alapú hangmodellt, a Microsoft által fejlesztett MAI-Voice-2.1 és MAI-Transcribe-2 működését vizsgálják valós példákon keresztül. Elsősorban a természetes beszédet utánzó hanggenerálásra és a gyors, többnyelvű beszédfelismerésre fókuszálnak.
A bemutatott interakciók a mesterséges intelligencia reakcióit és korlátait is szemléltetik: a beszélgetőpartner különféle, akár provokatív vagy szokatlan kérdéseket tesz fel, miközben az AI igyekszik udvarias és semleges válaszokat adni, bizonyos témákban pedig tudatosan elzárkózik a konkrét segítségnyújtástól.
A kísérlet során bemutatásra kerül, hogy a Transcribe-2 modell mennyire gyorsan és pontosan képes 60 nyelven felismerni a beszédet, valamint az is, hogyan bővítették a Voice 2.1 modellt, amely most már 23 nyelven képes ugyanazzal a hanggal, natív akcentussal megszólalni. Külön érdekes, hogy a különböző hangprofilokat (narrátor, oktató, ügyfélszolgálati) és a gyorsasági beállításokat is tesztelik különböző nyelvekben.
A videó felveti, hogy ezek a fejlesztések mennyire közelítik meg egy valódi emberi beszélgetés élményét, miközben rámutat arra is, milyen szabályozások befolyásolják az AI válaszadási lehetőségeit. Érdekes kérdésként merül fel, hogy mikor – és mennyire lesznek ezek a hangmodellek elérhetők nyílt forráskóddal a közösség számára.










