Slovník výrazov AI/Multimodálna AI

Multimodálna AI

textovo-obrazový model

Anglický výraz text-image model

základnéheslo č. 8075 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená textovo-obrazový model?

Textovo-obrazový model sa učí vzťah medzi textovými a obrazovými dátami, aby ich porovnával, kódoval alebo generoval jednu modalitu podmienenú druhou. Pojem zahŕňa diskriminačné modely spoločných vnorení aj generatívne modely; ich ciele a výstupy sa preto musia uvádzať presne.

Skúsenosť a kontext

Ako sa pojem používa v praxi

E-shop používa model na priradenie popisu k fotografii produktu a na odhalenie nesúladov. Názov, farba a typ sa porovnajú s vizuálnymi znakmi, no výsledok iba označí položku na kontrolu. Katalógové fotografie a texty majú licenciu a test obsahuje podobné varianty.

Overiteľnosť

Odborné zdroje

  1. Radford et al. - Learning Transferable Visual Models From Natural Language Supervisionarxiv.org
  2. van den Oord et al. - Conditional Image Generation with PixelCNN Decodersarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje textovo-obrazový model?

Dvojica enkóderov môže optimalizovať podobnosť textu a obrazu, kým generatívna verzia dekóduje obrazové alebo textové tokeny podmienené druhou modalitou.

Kedy má textovo-obrazový model praktický význam?

E-shop používa model na priradenie popisu k fotografii produktu a na odhalenie nesúladov.

S čím si pojem nezamieňať?

Vision-language model sa často sústreďuje na jazykové porozumenie obrazu; text-image model je širšie označenie aj pre vyhľadávanie a generovanie.

Ako sa výsledok kontroluje?

Overuje sa obojsmerné vyhľadávanie, zhoda atribútov, kvalita generovania, citlivosť promptu, zovšeobecnenie a dátové licencie.

Na čo si dať pozor?

Model môže spájať časté slová s pozadím namiesto produktu a pri generovaní reprodukovať skreslenia alebo prvky tréningových dát.