Slovník výrazov AI/Architektúry hlbokého učenia

Architektúry hlbokého učenia

model sekvencia-na-sekvenciu

Anglický výraz sequence-to-sequence model

základnéheslo č. 3085 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená model sekvencia-na-sekvenciu?

Model sekvencia-na-sekvenciu mapuje vstupnú postupnosť premenlivej dĺžky na výstupnú postupnosť, ktorá môže mať inú dĺžku aj slovník. Enkóder vytvára reprezentácie vstupu a autoregresívny dekóder odhaduje ďalší prvok podmienený vstupom a doterajším výstupom. Pôvodná realizácia používala LSTM; dnešné seq2seq modely môžu byť rekurentné aj transformátorové.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri strojovom preklade alebo prevode reči na text sa pripravujú párované sekvencie, špeciálne značky začiatku a konca a masky paddingu. Tréning často poskytuje dekóderu správny predchádzajúci token, zatiaľ čo pri inferencii model používa vlastné voľby; preto sa kvalita overuje skutočným dekódovaním, nie iba stratou s teacher forcingom. Tím nastaví greedy alebo beam search, obmedzenia dĺžky a pravidlá pre neplatné výstupy.

Overiteľnosť

Odborné zdroje

  1. Sutskever et al. · Sequence to Sequence Learningarxiv.org
  2. Bahdanau et al. · Neural machine translationarxiv.org

Praktické odpovede

Často kladené otázky

Musia mať vstup a výstup rovnaký počet prvkov?

Nie, dĺžky sú nezávislé.

Ako končí generovanie?

Vyberie značku konca alebo dosiahne stanovený limit.

Čo znamená?

Počas tréningu sa ako predchádzajúci krok použije pravý cieľový prvok.

Je najvyššia lokálna pravdepodobnosť vždy najlepšia?

Nie; beam search porovnáva viac čiastkových sekvencií.

Stačí tokenová strata?

Nie, treba hodnotiť celé vygenerované sekvencie a chyby významné pre úlohu.