Presná definícia
Čo znamená rozdelenie údajov?
Rozdelenie údajov je pravidlo, ktorým sa pozorovania priraďujú do tréningovej, validačnej a testovacej časti alebo do záhybov krížovej validácie. Cieľom nie je iba zvoliť percentá, ale zabrániť toku informácie medzi časťami a napodobniť budúce použitie. Jednotkou delenia môže byť osoba, zariadenie, lokalita alebo čas; náhodné delenie jednotlivých riadkov je chybné, ak riadky nie sú nezávislé.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Pred čistením sa identifikuje entita, ktorá sa nesmie objaviť na oboch stranách - napríklad zákazník so stovkami transakcií. Pri predikcii budúcnosti sa používa chronologické delenie bez údajov z budúcnosti; pri triedach sa môže zachovať stratifikácia, ak neporuší skupiny. Seed a zoznam identifikátorov sa ukladajú, aby boli porovnania modelov férové. Skontrolujú sa duplicity, príbuzné snímky a agregácie vypočítané cez celé dáta. Protokol sa volí podľa otázky nasadenia, nie podľa najvyššieho skóre.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Existuje univerzálne delenie 80/20?
Nie. Potrebná veľkosť závisí od objemu, variability, ladenia a požadovanej presnosti odhadu.
Prečo deliť podľa používateľa?
Viac riadkov tej istej osoby je závislých a môže prezradiť identitu alebo budúce správanie.
Kedy použiť chronologický split?
Keď má model predikovať budúcnosť alebo sa dátový proces mení v čase.
Prečo deliť ešte pred imputáciou?
Štatistika vypočítaná z celého súboru prenesie informáciu z testu do tréningu.
Stačí uložiť náhodný seed?
Nie vždy. Verzia knižnice a poradie dát sa môžu zmeniť, preto je vhodné uložiť aj priradenia.
Prihlásiť / registrovať