Reč a zvuk

transduktorový model

Anglický výraz transducer model

pokročiléheslo č. 7815 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená transduktorový model?

Transduktorový model v reči, najmä RNN-T, mapuje vstupnú akustickú sekvenciu na výstupné tokeny bez pevného zarovnania. Spája akustický encoder, prediction network nad predchádzajúcimi tokenmi a joint network. Umožňuje priebežné dekódovanie, pričom tokeny vznikajú monotónne v čase.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Mobilný diktát používa streaming RNN-T s obmedzenou pamäťou kontextu. Tím meria WER aj oneskorenie prvého a finálneho slova a testuje nestabilné čiastkové prepisy. Zmeny slovníka sa validujú bez nekontrolovaného rastu dekódovacieho lúča.

Overiteľnosť

Odborné zdroje

  1. Sequence Transduction with Recurrent Neural Networksarxiv.org
  2. Emformer: Efficient Memory Transformer Based Acoustic Model for Low Latency Streaming Speech Recognitionarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje transduktorový model?

Joint network kombinuje aktuálny akustický stav s históriou výstupov a predikuje token alebo blank, čím implicitne určuje zarovnanie.

Kedy má transduktorový model praktický význam?

Mobilný diktát používa streaming RNN-T s obmedzenou pamäťou kontextu.

S čím si pojem nezamieňať?

CTC nemá samostatný autoregresívny predikčný modul; transduktor modeluje závislosť ďalšieho tokenu od už vydaného textu.

Ako sa výsledok kontroluje?

Meria sa WER/CER, token emission latencia, endpointing, stability partial hypotheses, real-time factor a pamäť.

Na čo si dať pozor?

Silná prediction network môže halucinovať jazykovo častý text a streaming kontext môže prepisovať menej než offline model.