Slovník výrazov AI/Multimodálna AI

Multimodálna AI

model CLIP

Anglický výraz CLIP model

špecializovanéheslo č. 8465 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená model CLIP?

CLIP je rodina dvojenkóderových modelov predtrénovaných kontrastívne na pároch obraz-text. Obrazový a textový enkóder vytvárajú normalizované vektory a podobnosť umožňuje zero-shot klasifikáciu či vyhľadávanie pomocou jazykových názvov. CLIP nie je generátor obrázkov ani detektor regiónov.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Fotobanka používa CLIP na predvýber obrázkov pre textový dopyt a výsledok filtruje licenciou a metadátami. Šablóny tried sa validujú v slovenčine, výsledky sa nemerajú len na angličtine. Citlivé rozpoznávanie osôb sa z rozsahu aplikácie vylúči.

Overiteľnosť

Odborné zdroje

  1. Radford et al. - Learning Transferable Visual Models From Natural Language Supervisionarxiv.org
  2. Mithun et al. - Webly Supervised Joint Embedding for Cross-Modal Image-Text Retrievalarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje model CLIP?

Model porovnáva kosínovú podobnosť obrazového vektora s textovými vektormi a pri klasifikácii normalizuje skóre zvolených promptov.

Kedy má model CLIP praktický význam?

Fotobanka používa CLIP na predvýber obrázkov pre textový dopyt a výsledok filtruje licenciou a metadátami.

S čím si pojem nezamieňať?

Generatívny text-to-image model syntetizuje pixely; CLIP primárne skóruje sémantickú zhodu existujúceho obrazu a textu.

Ako sa výsledok kontroluje?

Meria sa zero-shot accuracy, image-text retrieval, prompt sensitivity, kalibrácia, výkon domén a sociálne skreslenia.

Na čo si dať pozor?

Výsledok závisí od slovného znenia tried a model môže využiť pozadie alebo webové korelácie namiesto požadovaného objektu.