Slovník výrazov AI/Generatívna AI

Generatívna AI

text-na-zvuk

Anglický výraz text-to-audio

špecializovanéheslo č. 4445 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená text-na-zvuk?

Text-na-zvuk je syntéza akustického signálu riadená prirodzeným jazykom, napríklad opisom udalosti, prostredia, reči alebo hudby. Model spája textovú reprezentáciu so zvukovými tokenmi, spektrogramom či vlnovým priebehom. Časovanie a súbežné zvuky musia byť naučené z párov text-audio a nemusia presne sledovať slovný opis.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Používa sa na návrhy ruchov, zvukové kulisy, prístupnostné rozhrania a prototypy. Zadanie uvádza zdroj, prostredie, trvanie a poradie udalostí; výsledok sa počúva na viacerých zariadeniach a overuje na nežiaduce hlasy či hudobné podobnosti. Pri hlasovej identite je potrebný súhlas a jasné označenie syntézy.

Overiteľnosť

Odborné zdroje

  1. AudioLM: a Language Modeling Approach to Audio Generationarxiv.org
  2. MusicLM: Generating Music From Textarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje text-na-zvuk?

Textový enkodér vytvorí podmienku, autoregresný alebo difúzny modul vygeneruje akustickú reprezentáciu a kodek ju dekóduje na zvuk.

Kedy má text-na-zvuk praktický význam?

Používa sa na návrhy ruchov, zvukové kulisy, prístupnostné rozhrania a prototypy.

S čím si pojem nezamieňať?

Generovanie zvuku môže vychádzať aj zo zvukovej referencie alebo symbolov; text-na-zvuk označuje práve slovný vstup.

Ako sa výsledok kontroluje?

Kontroluje sa zhoda udalostí a ich poradia s promptom, perceptuálna kvalita, šum, dĺžka, rozmanitosť a hlasová podobnosť.

Na čo si dať pozor?

Model môže spojiť nekompatibilné zvuky, zameniť poradie deja alebo neúmyselne napodobniť rozpoznateľný hlas či nahrávku.