Slovník výrazov AI/Multimodálna AI

Multimodálna AI

vizuálne ukotvenie

Anglický výraz visual grounding

pokročiléheslo č. 8215 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená vizuálne ukotvenie?

Vizuálne ukotvenie spája jazykový výraz s konkrétnym regiónom alebo regiónmi obrazu, ktoré výraz označuje. Výstupom môže byť ohraničujúci rámček, maska, bod či priestorové súradnice. Úloha vyžaduje zároveň porozumenie textu, objektom a ich vzťahom.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Používateľ povie robotu „vezmi malú modrú škatuľu vľavo od monitora“. Systém zvýrazní cieľový región a pred uchopením vyžiada potvrdenie pri nízkej istote. Test obsahuje viac podobných predmetov, negácie, prekrytie a zmeny uhla kamery.

Overiteľnosť

Odborné zdroje

  1. Xiao et al. - Towards Visual Grounding: A Surveyarxiv.org
  2. Liu et al. - Visual Instruction Tuningarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje vizuálne ukotvenie?

Textový a vizuálny enkóder vytvoria reprezentácie, ktoré detekčný alebo segmentačný modul použije na skórovanie regiónov voči výrazu.

Kedy má vizuálne ukotvenie praktický význam?

Používateľ povie robotu „vezmi malú modrú škatuľu vľavo od monitora“.

S čím si pojem nezamieňať?

Detekcia objektov hľadá triedy z pevného zoznamu; visual grounding lokalizuje cieľ opísaný voľným jazykom a vzťahmi.

Ako sa výsledok kontroluje?

Meria sa box alebo mask IoU, recall pri prahu, point accuracy, výsledky podľa dĺžky výrazu, vzťahov a rušivých objektov.

Na čo si dať pozor?

Model môže lokalizovať typický objekt namiesto konkrétneho referenta a pri neurčitom texte predstierať jednoznačnosť.