Presná definícia
Čo znamená zhlukovanie reprezentácií?
Zhlukovanie reprezentácií aplikuje zhlukovací algoritmus na naučené vektory - embeddingy alebo latentné kódy - namiesto surových dát. Výsledné skupiny odrážajú invariancie a podobnosti zakódované reprezentačným modelom. Preto nemožno oddeliť kvalitu zhlukov od tréningového cieľa, zdrojových dát, normalizácie a metriky reprezentácie.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Obrázky sa najprv prevedú predtrénovaným modelom na embeddingy, ktoré sa L2-normalizujú, ak sa má kosínusová podobnosť rovnať euklidovskému poradiu. Následne sa porovná k-means, HDBSCAN alebo spektrálna metóda. Zhluky sa kontrolujú manuálnymi vzorkami, stabilitou a známymi atribútmi, ktoré neboli cieľom. Ak reprezentácia zachytáva pozadie namiesto objektu, zhlukovanie tento problém iba zosilní. Verzia enkódera sa preto ukladá spolu so zhlukovým modelom a pri jej zmene sa analýza opakuje.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Prečo nezhlukovať surové dáta?
V surovom priestore môže vzdialenosť zdôrazňovať technické detaily namiesto významu.
Je kosínusová podobnosť automaticky najlepšia?
Nie. Musí zodpovedať tréningu embeddingu a cieľu použitia.
Čo mení L2 normalizácia?
Odstraňuje veľkosť vektora a ponechá najmä jeho smer.
Môžu zhluky zdediť bias modelu?
Áno. Reprezentácia môže organizovať body podľa neželaných alebo citlivých atribútov.
Prečo verziovať enkóder?
Nová reprezentácia mení geometriu a staré centroidy či prahy prestanú platiť.
Prihlásiť / registrovať