Presná definícia
Čo znamená text-na-zvuk?
Text-na-zvuk je syntéza akustického signálu riadená prirodzeným jazykom, napríklad opisom udalosti, prostredia, reči alebo hudby. Model spája textovú reprezentáciu so zvukovými tokenmi, spektrogramom či vlnovým priebehom. Časovanie a súbežné zvuky musia byť naučené z párov text-audio a nemusia presne sledovať slovný opis.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Používa sa na návrhy ruchov, zvukové kulisy, prístupnostné rozhrania a prototypy. Zadanie uvádza zdroj, prostredie, trvanie a poradie udalostí; výsledok sa počúva na viacerých zariadeniach a overuje na nežiaduce hlasy či hudobné podobnosti. Pri hlasovej identite je potrebný súhlas a jasné označenie syntézy.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje text-na-zvuk?
Textový enkodér vytvorí podmienku, autoregresný alebo difúzny modul vygeneruje akustickú reprezentáciu a kodek ju dekóduje na zvuk.
Kedy má text-na-zvuk praktický význam?
Používa sa na návrhy ruchov, zvukové kulisy, prístupnostné rozhrania a prototypy.
S čím si pojem nezamieňať?
Generovanie zvuku môže vychádzať aj zo zvukovej referencie alebo symbolov; text-na-zvuk označuje práve slovný vstup.
Ako sa výsledok kontroluje?
Kontroluje sa zhoda udalostí a ich poradia s promptom, perceptuálna kvalita, šum, dĺžka, rozmanitosť a hlasová podobnosť.
Na čo si dať pozor?
Model môže spojiť nekompatibilné zvuky, zameniť poradie deja alebo neúmyselne napodobniť rozpoznateľný hlas či nahrávku.
Prihlásiť / registrovať