Presná definícia
Čo znamená distribúcia údajov?
Distribúcia údajov je pravdepodobnostný opis toho, aké hodnoty a kombinácie vstupov, cieľov a chýb sa v určenej populácii vyskytujú a s akou pravdepodobnosťou. Zahŕňa okrajové aj spoločné rozdelenia a závislosti; nie je totožná s histogramom jedného súboru, ktorý je iba konečným pozorovaním. Predpoklad rovnakého rozdelenia medzi tréningom a nasadením je modelová podmienka, ktorú treba priebežne preverovať.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Pred tréningom sa vytvorí dátový profil: rozsahy, chýbajúce hodnoty, kategórie, korelácie, čas a zastúpenie skupín. Profil sa uloží s verziou dát a porovnáva s validáciou aj produkčnými oknami pomocou vecne zvolených mier, nie mechanických prahov pre stovky príznakov. Zmena distribúcie nemusí zhoršiť model, ak ide o nerelevantný príznak; naopak malá zmena pri kritickej hranici môže byť závažná. Monitoring preto spája drift vstupov, distribúciu predikcií, dostupné štítky a prevádzkový dopad.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo opisuje p(x,y)?
Súčasné pravdepodobnosti kombinácií vstupu x a cieľa y, z ktorých možno odvodiť okrajové a podmienené rozdelenia.
Aký je rozdiel od empirickej distribúcie?
Empirická distribúcia priraďuje hmotnosť pozorovaným bodom; je odhadom širšieho dátového procesu.
Čo znamená identically distributed?
Každý príklad pochádza z rovnakého rozdelenia; v čase alebo skupinách to často neplatí.
Je každá zmena škodlivá?
Nie. Závažnosť závisí od toho, či ovplyvní vzťah k cieľu, rozhodovaciu hranicu a následky.
Ako sa distribúcia dokumentuje?
Súhrnmi, grafmi, časovým a skupinovým rozpadom, schémou zberu a verziou populácie.
Prihlásiť / registrovať