Presná definícia
Čo znamená náhodný les?
Náhodný les je ansámbel rozhodovacích stromov trénovaných na bootstrapových vzorkách, pričom pri každom delení sa zvažuje náhodná podmnožina príznakov. Priemerovanie znižuje rozptyl korelovaných hlbokých stromov. Náhodnosť príznakov podporuje rozmanitosť; les však neodstraňuje systematické skreslenie dát ani neposkytuje kauzálnu interpretáciu dôležitosti.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Pre tabulárnu predikciu sa nastavuje počet stromov, počet príznakov pri delení, hĺbka a minimálna veľkosť listu. Out-of-bag odhad vie poskytnúť internú kontrolu, no nenahrádza konečný test pri časovej alebo skupinovej závislosti. Viac stromov stabilizuje priemer, ale nezachráni nesprávne príznaky. Dôležitosť založená na poklese nečistoty môže zvýhodniť spojité a vysokokardinálne premenné; vhodnejšia býva permutačná dôležitosť na validačných dátach. Pravdepodobnosti sa podľa potreby kalibrujú.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Používa každý strom všetky príklady?
Trénuje sa na vzorke s opakovaním; časť príkladov zostane out-of-bag.
Prečo obmedziť príznaky pri delení?
Znižuje koreláciu stromov a zvyšuje úžitok priemerovania.
Môže priveľa stromov prefitovať?
Zvyčajne skôr stabilizujú odhad, no zvyšujú čas a nevyriešia zlé nastavenia či dáta.
Čo je out-of-bag skóre?
Hodnotenie príkladu stromami, ktoré ho vo svojej bootstrapovej vzorke nepoužili.
Je impurity importance dôkaz príčiny?
Nie. Je modelovo a dátovo závislá a môže byť systematicky skreslená.
Prihlásiť / registrovať