Reč a zvuk

audiovizuálne rozpoznávanie reči

Anglický výraz audiovisual speech recognition

špecializovanéheslo č. 7945 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená audiovizuálne rozpoznávanie reči?

Audiovizuálne rozpoznávanie reči spája akustický signál s časovo synchronizovanými vizuálnymi znakmi úst alebo tváre. Vizuálna vetva môže pomôcť pri hluku a rozlíšiť aktívneho hovoriaceho, no pri dobrom zvuku nemusí priniesť zisk. Fúzia musí zvládnuť chýbajúci či posunutý kanál.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Prepis videokonferencie použije obraz len so súhlasom a pri silnom akustickom šume. Pipeline overí synchronizáciu, viditeľnosť úst a umožní audio-only režim. Eval porovná audio, video aj fúziu pri rôznych SNR a pri umelo posunutom obraze.

Overiteľnosť

Odborné zdroje

  1. Deep Audio-Visual Speech Recognitionarxiv.org
  2. LipNet: End-to-End Sentence-level Lipreadingarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje audiovizuálne rozpoznávanie reči?

Samostatné encodery vytvoria audio a video reprezentácie, ktoré sa časovo zarovnajú a zlúčia pred CTC alebo sekvenčným dekódovaním.

Kedy má audiovizuálne rozpoznávanie reči praktický význam?

Prepis videokonferencie použije obraz len so súhlasom a pri silnom akustickom šume.

S čím si pojem nezamieňať?

Lip reading používa iba vizuál; AVSR kombinuje obraz so zvukom a má sa bezpečne vrátiť k dostupnej modalite.

Ako sa výsledok kontroluje?

Hodnotí sa WER podľa SNR, prínos oproti audio-only, odolnosť voči desynchronizácii, chýbajúcemu obrazu a zakrytiu.

Na čo si dať pozor?

Posunuté video môže systém zhoršiť a viditeľná tvár inej osoby môže nesprávne ovplyvniť prepis aktívneho hovoriaceho.