Presná definícia
Čo znamená vizuálny transformátor?
Vizuálny transformátor prevádza obraz na sekvenciu patchov, každý patch lineárne premietne do tokenu, pridá pozičnú informáciu a spracuje ich transformátorovým enkóderom. Pri klasifikácii sa používa osobitný token alebo agregácia výstupov. Na rozdiel od CNN nemá zabudovanú lokálnu konvolúciu v každej vrstve, preto sa pri menších dátach viac opiera o predtrénovanie a augmentáciu.
Skúsenosť a kontext
Ako sa pojem používa v praxi
ViT sa používa na klasifikáciu obrazu a ako backbone pre detekciu či segmentáciu. Veľkosť patchu určuje kompromis: menšie patche zachovajú viac detailov, ale kvadraticky zvýšia počet interakcií. Tím sleduje rozlíšenie, interpoláciu pozičných embeddingov a správanie pri orezaní. Férové porovnanie s CNN musí mať podobný rozpočet dát, augmentácií, predtrénovania a výpočtu; inak výsledok pripisuje architektúre aj rozdielnej tréningovej schéme.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako vzniknú obrazové tokeny?
Obraz sa rozdelí na pevné patche, sploští a lineárne premietne.
Čo spôsobí menší patch?
Viac tokenov, jemnejší detail a vyššie náklady pozornosti.
Prečo treba pozičný signál?
Samotná sebapozornosť nerozlišuje usporiadanie patchov.
Ako vznikne jeden výstup?
Z klasifikačného tokenu alebo agregácie tokenových reprezentácií.
Je ViT lokálny ako CNN?
Nie automaticky; lokalitu sa musí naučiť alebo dostať úpravou architektúry.
Prihlásiť / registrovať