Slovník výrazov AI/Učenie bez učiteľa

Učenie bez učiteľa

zhlukovanie reprezentácií

Anglický výraz representation clustering

pokročiléheslo č. 1865 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená zhlukovanie reprezentácií?

Zhlukovanie reprezentácií aplikuje zhlukovací algoritmus na naučené vektory - embeddingy alebo latentné kódy - namiesto surových dát. Výsledné skupiny odrážajú invariancie a podobnosti zakódované reprezentačným modelom. Preto nemožno oddeliť kvalitu zhlukov od tréningového cieľa, zdrojových dát, normalizácie a metriky reprezentácie.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Obrázky sa najprv prevedú predtrénovaným modelom na embeddingy, ktoré sa L2-normalizujú, ak sa má kosínusová podobnosť rovnať euklidovskému poradiu. Následne sa porovná k-means, HDBSCAN alebo spektrálna metóda. Zhluky sa kontrolujú manuálnymi vzorkami, stabilitou a známymi atribútmi, ktoré neboli cieľom. Ak reprezentácia zachytáva pozadie namiesto objektu, zhlukovanie tento problém iba zosilní. Verzia enkódera sa preto ukladá spolu so zhlukovým modelom a pri jej zmene sa analýza opakuje.

Overiteľnosť

Odborné zdroje

  1. scikit-learn · Clusteringscikit-learn.org
  2. Deep Learning Book · Autoencodersdeeplearningbook.org

Praktické odpovede

Často kladené otázky

Prečo nezhlukovať surové dáta?

V surovom priestore môže vzdialenosť zdôrazňovať technické detaily namiesto významu.

Je kosínusová podobnosť automaticky najlepšia?

Nie. Musí zodpovedať tréningu embeddingu a cieľu použitia.

Čo mení L2 normalizácia?

Odstraňuje veľkosť vektora a ponechá najmä jeho smer.

Môžu zhluky zdediť bias modelu?

Áno. Reprezentácia môže organizovať body podľa neželaných alebo citlivých atribútov.

Prečo verziovať enkóder?

Nová reprezentácia mení geometriu a staré centroidy či prahy prestanú platiť.