Presná definícia
Čo znamená model CLIP?
CLIP je rodina dvojenkóderových modelov predtrénovaných kontrastívne na pároch obraz-text. Obrazový a textový enkóder vytvárajú normalizované vektory a podobnosť umožňuje zero-shot klasifikáciu či vyhľadávanie pomocou jazykových názvov. CLIP nie je generátor obrázkov ani detektor regiónov.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Fotobanka používa CLIP na predvýber obrázkov pre textový dopyt a výsledok filtruje licenciou a metadátami. Šablóny tried sa validujú v slovenčine, výsledky sa nemerajú len na angličtine. Citlivé rozpoznávanie osôb sa z rozsahu aplikácie vylúči.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje model CLIP?
Model porovnáva kosínovú podobnosť obrazového vektora s textovými vektormi a pri klasifikácii normalizuje skóre zvolených promptov.
Kedy má model CLIP praktický význam?
Fotobanka používa CLIP na predvýber obrázkov pre textový dopyt a výsledok filtruje licenciou a metadátami.
S čím si pojem nezamieňať?
Generatívny text-to-image model syntetizuje pixely; CLIP primárne skóruje sémantickú zhodu existujúceho obrazu a textu.
Ako sa výsledok kontroluje?
Meria sa zero-shot accuracy, image-text retrieval, prompt sensitivity, kalibrácia, výkon domén a sociálne skreslenia.
Na čo si dať pozor?
Výsledok závisí od slovného znenia tried a model môže využiť pozadie alebo webové korelácie namiesto požadovaného objektu.
Prihlásiť / registrovať