Slovník výrazov AI/Architektúry hlbokého učenia

Architektúry hlbokého učenia

sebapozornosť

Anglický výraz self-attention

základnéheslo č. 3105 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená sebapozornosť?

Sebapozornosť je pozornosť, pri ktorej dopyty, kľúče aj hodnoty vznikajú z tej istej sekvencie alebo množiny reprezentácií. Každá pozícia tak vytvára nový stav vážením ostatných povolených pozícií. Bez pozičnej informácie je operácia necitlivá na poradie; kauzálna maska navyše zabezpečí, že pozícia pri generovaní nevidí budúce prvky.

Skúsenosť a kontext

Ako sa pojem používa v praxi

V transformátore sebapozornosť mieša informáciu medzi tokenmi, obrazovými patchmi alebo prvkami množiny. Tím rozlišuje plnú, kauzálnu a lokálnu masku a testuje, či neplatné pozície dostali prakticky nulovú váhu. Pamäť plnej pozornosti rastie približne kvadraticky s dĺžkou sekvencie, preto sa pri dlhých vstupoch zvažuje oknovanie, riedka pozornosť alebo delenie. Pozičné kódy sa overujú aj na dĺžkach mimo tréningového rozsahu.

Overiteľnosť

Odborné zdroje

  1. Vaswani et al. · Attention Is All You Needproceedings.neurips.cc
  2. PyTorch · MultiheadAttentiondocs.pytorch.org

Praktické odpovede

Často kladené otázky

Odkiaľ pochádzajú Q, K a V?

Z rôznych naučených projekcií tej istej vstupnej reprezentácie.

Pozná operácia sama poradie tokenov?

Nie, potrebuje pozičnú informáciu alebo štruktúrnu masku.

Ako sa zabráni pohľadu dopredu?

Skóre budúcich pozícií sa pred softmaxom zamaskujú.

Prečo je dlhá sekvencia drahá?

Plná matica skóre obsahuje dvojicu pre každý dopyt a kľúč.

Musí token pozerať na seba?

Nie; diagonálu možno povoliť alebo maskovať podľa úlohy.