Slovník výrazov AI/Multimodálna AI

Multimodálna AI

vizuálno-jazykový model

Anglický výraz vision-language model

základnéheslo č. 8045 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená vizuálno-jazykový model?

Vizuálno-jazykový model prepája reprezentáciu obrazu alebo videa s prirodzeným jazykom, aby vykonával úlohy ako opis, vizuálne otázky, vyhľadávanie či ukotvenie objektov. Typicky kombinuje vizuálny enkóder s jazykovým modelom cez projekciu alebo krížovú pozornosť.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Servisný pracovník odfotí ovládací panel a spýta sa na význam kontrolky. Model najprv musí prečítať správny región, potom odpovedať podľa schválenej príručky. Test zahŕňa otočené fotografie, malé písmo aj otázky, na ktoré snímka neposkytuje odpoveď.

Overiteľnosť

Odborné zdroje

  1. Liu et al. - Visual Instruction Tuningarxiv.org
  2. Radford et al. - Learning Transferable Visual Models From Natural Language Supervisionarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje vizuálno-jazykový model?

Vizuálny enkóder vytvorí tokeny obrazu, spojovací modul ich prispôsobí jazykovému priestoru a dekóder podmiení odpoveď vizuálnym aj textovým kontextom.

Kedy má vizuálno-jazykový model praktický význam?

Servisný pracovník odfotí ovládací panel a spýta sa na význam kontrolky.

S čím si pojem nezamieňať?

Obrazový klasifikátor vracia triedu z pevného zoznamu; vision-language model interpretuje alebo generuje otvorený jazyk viazaný na vizuálny obsah.

Ako sa výsledok kontroluje?

Overuje sa VQA a captioning výkon, lokalizácia dôkazov, OCR citlivosť, halucinácie objektov, robustnosť rozlíšenia a jazyková správnosť.

Na čo si dať pozor?

Jazyková plynulosť môže zakryť chybné videnie a model môže sebavedomo pomenovať predmet, ktorý na snímke nie je.