Reč a zvuk

automatické rozpoznávanie reči

Anglický výraz automatic speech recognition

základnéheslo č. 7525 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená automatické rozpoznávanie reči?

Automatické rozpoznávanie reči (ASR) je strojové vykonanie prevodu hovoreného zvuku na text alebo inú symbolickú sekvenciu bez priebežného ľudského prepisu. Systém môže byť dávkový alebo priebežný a end-to-end či modulárny. Označenie automatické neznamená bezchybný ani bezdozorový výstup.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Kontaktné centrum vytvára návrh prepisu hovorov na vyhľadávanie a kontrolu kvality. Citlivé údaje sa redigujú, prístupy logujú a model sa testuje na vlastnom slovníku. Rozhodnutie o zákazníkovi nevzniká len z automatického prepisu s nízkou istotou.

Overiteľnosť

Odborné zdroje

  1. Robust Speech Recognition via Large-Scale Weak Supervisionarxiv.org
  2. Connectionist Temporal Classificationcs.toronto.edu

Praktické odpovede

Často kladené otázky

Ako funguje automatické rozpoznávanie reči?

Model vyhodnotí akustické rámce a pomocou CTC, transduktora alebo attention dekódera zostaví tokeny, slová a časové značky.

Kedy má automatické rozpoznávanie reči praktický význam?

Kontaktné centrum vytvára návrh prepisu hovorov na vyhľadávanie a kontrolu kvality.

S čím si pojem nezamieňať?

Speech-to-text je používateľská funkcia; ASR označuje modelovú úlohu a technickú pipeline, ktorá túto funkciu realizuje.

Ako sa výsledok kontroluje?

Kontroluje sa WER/CER, named-entity error, latencia, stabilita priebežných hypotéz, výkon skupín a robustnosť hluku.

Na čo si dať pozor?

Automatický prepis môže vynechať negáciu, zmeniť číslo a vytvoriť nerovnakú chybovosť pre akcenty či kvalitu mikrofónu.