Slovník výrazov AI/Základy strojového učenia

Základy strojového učenia

rozdelenie údajov

Anglický výraz data split

základnéheslo č. 665 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená rozdelenie údajov?

Rozdelenie údajov je pravidlo, ktorým sa pozorovania priraďujú do tréningovej, validačnej a testovacej časti alebo do záhybov krížovej validácie. Cieľom nie je iba zvoliť percentá, ale zabrániť toku informácie medzi časťami a napodobniť budúce použitie. Jednotkou delenia môže byť osoba, zariadenie, lokalita alebo čas; náhodné delenie jednotlivých riadkov je chybné, ak riadky nie sú nezávislé.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pred čistením sa identifikuje entita, ktorá sa nesmie objaviť na oboch stranách - napríklad zákazník so stovkami transakcií. Pri predikcii budúcnosti sa používa chronologické delenie bez údajov z budúcnosti; pri triedach sa môže zachovať stratifikácia, ak neporuší skupiny. Seed a zoznam identifikátorov sa ukladajú, aby boli porovnania modelov férové. Skontrolujú sa duplicity, príbuzné snímky a agregácie vypočítané cez celé dáta. Protokol sa volí podľa otázky nasadenia, nie podľa najvyššieho skóre.

Overiteľnosť

Odborné zdroje

  1. scikit-learn · Cross-validationscikit-learn.org
  2. scikit-learn · Common Pitfallsscikit-learn.org

Praktické odpovede

Často kladené otázky

Existuje univerzálne delenie 80/20?

Nie. Potrebná veľkosť závisí od objemu, variability, ladenia a požadovanej presnosti odhadu.

Prečo deliť podľa používateľa?

Viac riadkov tej istej osoby je závislých a môže prezradiť identitu alebo budúce správanie.

Kedy použiť chronologický split?

Keď má model predikovať budúcnosť alebo sa dátový proces mení v čase.

Prečo deliť ešte pred imputáciou?

Štatistika vypočítaná z celého súboru prenesie informáciu z testu do tréningu.

Stačí uložiť náhodný seed?

Nie vždy. Verzia knižnice a poradie dát sa môžu zmeniť, preto je vhodné uložiť aj priradenia.