Slovník výrazov AI/Multimodálna AI

Multimodálna AI

multimodálne vnorenie

Anglický výraz multimodal embedding

základnéheslo č. 8085 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená multimodálne vnorenie?

Multimodálne vnorenie je naučený vektor pre objekt z jednej alebo viacerých modalít, ktorého geometria kóduje vzťahy využiteľné naprieč modalitami. Význam vzdialenosti závisí od tréningového cieľa, normalizácie a verzie modelu; nejde o univerzálny opis obsahu.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Mediálny archív uloží vnorenia obrázkov, zvukov a textových popisov a umožní spoločné vyhľadávanie. Pri každom vektore eviduje model a preprocessing; po zmene verzie index prepočíta. Citlivé informácie sa testujú na možnú spätnú inferenciu.

Overiteľnosť

Odborné zdroje

  1. Girdhar et al. - ImageBind: One Embedding Space To Bind Them Allarxiv.org
  2. Radford et al. - Learning Transferable Visual Models From Natural Language Supervisionarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje multimodálne vnorenie?

Enkóder mapuje vstup na pevne dlhý vektor a kontrastívna strata približuje zodpovedajúce páry, pričom oddeľuje nezhodné príklady.

Kedy má multimodálne vnorenie praktický význam?

Mediálny archív uloží vnorenia obrázkov, zvukov a textových popisov a umožní spoločné vyhľadávanie.

S čím si pojem nezamieňať?

Unimodálne vnorenie zachytáva podobnosť v jednom type dát; multimodal embedding je optimalizované aj na väzby medzi rozdielnymi typmi.

Ako sa výsledok kontroluje?

Meria sa cross-modal recall@k, lineárne sondy, separácia negatívov, kalibrácia podobnosti, robustnosť a kompatibilita indexu.

Na čo si dať pozor?

Vektor môže neúmyselne uchovať identitu alebo citlivý atribút a rovnaká číselná vzdialenosť nie je porovnateľná medzi verziami modelu.