Slovník výrazov AI/Architektúry hlbokého učenia

Architektúry hlbokého učenia

vizuálny transformátor

Anglický výraz vision transformer

základnéheslo č. 3145 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená vizuálny transformátor?

Vizuálny transformátor prevádza obraz na sekvenciu patchov, každý patch lineárne premietne do tokenu, pridá pozičnú informáciu a spracuje ich transformátorovým enkóderom. Pri klasifikácii sa používa osobitný token alebo agregácia výstupov. Na rozdiel od CNN nemá zabudovanú lokálnu konvolúciu v každej vrstve, preto sa pri menších dátach viac opiera o predtrénovanie a augmentáciu.

Skúsenosť a kontext

Ako sa pojem používa v praxi

ViT sa používa na klasifikáciu obrazu a ako backbone pre detekciu či segmentáciu. Veľkosť patchu určuje kompromis: menšie patche zachovajú viac detailov, ale kvadraticky zvýšia počet interakcií. Tím sleduje rozlíšenie, interpoláciu pozičných embeddingov a správanie pri orezaní. Férové porovnanie s CNN musí mať podobný rozpočet dát, augmentácií, predtrénovania a výpočtu; inak výsledok pripisuje architektúre aj rozdielnej tréningovej schéme.

Overiteľnosť

Odborné zdroje

  1. Dosovitskiy et al. · Vision Transformerarxiv.org
  2. Vaswani et al. · Attention Is All You Needproceedings.neurips.cc

Praktické odpovede

Často kladené otázky

Ako vzniknú obrazové tokeny?

Obraz sa rozdelí na pevné patche, sploští a lineárne premietne.

Čo spôsobí menší patch?

Viac tokenov, jemnejší detail a vyššie náklady pozornosti.

Prečo treba pozičný signál?

Samotná sebapozornosť nerozlišuje usporiadanie patchov.

Ako vznikne jeden výstup?

Z klasifikačného tokenu alebo agregácie tokenových reprezentácií.

Je ViT lokálny ako CNN?

Nie automaticky; lokalitu sa musí naučiť alebo dostať úpravou architektúry.