Slovník výrazov AI/Prenosové a úsporné učenie

Prenosové a úsporné učenie

učenie z pozitívnych a neoznačených dát

Anglický výraz positive-unlabeled learning

základnéheslo č. 2055 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená učenie z pozitívnych a neoznačených dát?

Učenie z pozitívnych a neoznačených dát rieši binárnu klasifikáciu, keď sú spoľahlivo známe iba niektoré pozitíva a zvyšok obsahuje neznámy mix pozitívnych aj negatívnych prípadov. Neoznačená množina preto nesmie byť automaticky považovaná za negatívnu. Metódy odhadujú sklon k označeniu, podiel tried alebo riziko tak, aby korigovali výberové skreslenie pozitívnych štítkov.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri hľadaní chýb sú známe potvrdené poruchy, no väčšina nepreskúmaných záznamov nie je potvrdeným „bez chyby“. Tím najprv zistí, ako sa prípady dostávajú medzi označené pozitíva, a či je pravdepodobnosť označenia v rámci pozitív približne náhodná. Model sa porovná s naivným negatívnym označením, kalibruje sa a vyhodnocuje na osobitne skontrolovanej vzorke. Ak sa označujú najmä nápadné poruchy, treba explicitne modelovať selekciu.

Overiteľnosť

Odborné zdroje

  1. Elkan & Noto · Positive-unlabeled learningdoi.org
  2. Bekker & Davis · PU learning surveydoi.org

Praktické odpovede

Často kladené otázky

Kde sú negatívne príklady?

Sú skryté v neoznačenej množine spolu s neobjavenými pozitívami.

Prečo nie je vhodné označiť všetko ostatné ako negatívne?

Vytvorilo by to falošné negatíva a skreslený model.

Čo znamená predpoklad SCAR?

Označené pozitíva sú z pozitívnej triedy vybrané približne náhodne.

Prečo treba odhad triedneho podielu?

Pomáha previesť pozorované označenia na riziko pre skutočné triedy.

Ako získať spoľahlivú metriku?

Náhodne overiť časť pozitívnych aj pôvodne neoznačených prípadov.