Presná definícia
Čo znamená audiovizuálne rozpoznávanie reči?
Audiovizuálne rozpoznávanie reči spája akustický signál s časovo synchronizovanými vizuálnymi znakmi úst alebo tváre. Vizuálna vetva môže pomôcť pri hluku a rozlíšiť aktívneho hovoriaceho, no pri dobrom zvuku nemusí priniesť zisk. Fúzia musí zvládnuť chýbajúci či posunutý kanál.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Prepis videokonferencie použije obraz len so súhlasom a pri silnom akustickom šume. Pipeline overí synchronizáciu, viditeľnosť úst a umožní audio-only režim. Eval porovná audio, video aj fúziu pri rôznych SNR a pri umelo posunutom obraze.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje audiovizuálne rozpoznávanie reči?
Samostatné encodery vytvoria audio a video reprezentácie, ktoré sa časovo zarovnajú a zlúčia pred CTC alebo sekvenčným dekódovaním.
Kedy má audiovizuálne rozpoznávanie reči praktický význam?
Prepis videokonferencie použije obraz len so súhlasom a pri silnom akustickom šume.
S čím si pojem nezamieňať?
Lip reading používa iba vizuál; AVSR kombinuje obraz so zvukom a má sa bezpečne vrátiť k dostupnej modalite.
Ako sa výsledok kontroluje?
Hodnotí sa WER podľa SNR, prínos oproti audio-only, odolnosť voči desynchronizácii, chýbajúcemu obrazu a zakrytiu.
Na čo si dať pozor?
Posunuté video môže systém zhoršiť a viditeľná tvár inej osoby môže nesprávne ovplyvniť prepis aktívneho hovoriaceho.
Prihlásiť / registrovať