Slovník výrazov AI/Základy strojového učenia

Základy strojového učenia

distribúcia údajov

Anglický výraz data distribution

pokročiléheslo č. 735 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená distribúcia údajov?

Distribúcia údajov je pravdepodobnostný opis toho, aké hodnoty a kombinácie vstupov, cieľov a chýb sa v určenej populácii vyskytujú a s akou pravdepodobnosťou. Zahŕňa okrajové aj spoločné rozdelenia a závislosti; nie je totožná s histogramom jedného súboru, ktorý je iba konečným pozorovaním. Predpoklad rovnakého rozdelenia medzi tréningom a nasadením je modelová podmienka, ktorú treba priebežne preverovať.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pred tréningom sa vytvorí dátový profil: rozsahy, chýbajúce hodnoty, kategórie, korelácie, čas a zastúpenie skupín. Profil sa uloží s verziou dát a porovnáva s validáciou aj produkčnými oknami pomocou vecne zvolených mier, nie mechanických prahov pre stovky príznakov. Zmena distribúcie nemusí zhoršiť model, ak ide o nerelevantný príznak; naopak malá zmena pri kritickej hranici môže byť závažná. Monitoring preto spája drift vstupov, distribúciu predikcií, dostupné štítky a prevádzkový dopad.

Overiteľnosť

Odborné zdroje

  1. Dataset Shift in Machine Learningacademic.oup.com
  2. Google · Generalization and Overfittingdevelopers.google.com

Praktické odpovede

Často kladené otázky

Čo opisuje p(x,y)?

Súčasné pravdepodobnosti kombinácií vstupu x a cieľa y, z ktorých možno odvodiť okrajové a podmienené rozdelenia.

Aký je rozdiel od empirickej distribúcie?

Empirická distribúcia priraďuje hmotnosť pozorovaným bodom; je odhadom širšieho dátového procesu.

Čo znamená identically distributed?

Každý príklad pochádza z rovnakého rozdelenia; v čase alebo skupinách to často neplatí.

Je každá zmena škodlivá?

Nie. Závažnosť závisí od toho, či ovplyvní vzťah k cieľu, rozhodovaciu hranicu a následky.

Ako sa distribúcia dokumentuje?

Súhrnmi, grafmi, časovým a skupinovým rozpadom, schémou zberu a verziou populácie.