Presná definícia
Čo znamená k najbližších susedov?
Metóda k najbližších susedov (k-NN) predikuje podľa k tréningových bodov najbližších novému vstupu v zvolenej metrike. Pri klasifikácii hlasujú ich triedy, pri regresii sa spriemerujú ciele, prípadne s váhou podľa vzdialenosti. Ide o lenivé učenie: explicitný globálny model sa takmer netrénuje a náklady sa presúvajú na vyhľadávanie pri predikcii.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Pri odporúčaní podobných položiek sa najprv vyberie reprezentácia a škála príznakov, pretože vzdialenosť je jadrom metódy. K sa ladí validáciou: malé hodnoty sú citlivé na šum, veľké zahladzujú lokálne skupiny. Pri nerovnomernej hustote pomáha váženie vzdialenosťou, no treba riešiť väzby a chýbajúce hodnoty. Vysoká rozmernosť znižuje rozlišovaciu schopnosť vzdialeností, preto sa často redukuje priestor. Indexy stromov urýchlia nízke rozmery; pri veľkých embeddingoch sa používajú aproximované susedské indexy.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Prečo sa nazýva lenivé učenie?
Väčšina výpočtu prebehne až pri dotaze, nie pri tvorbe parametrického modelu.
Čo spôsobí malé k?
Nízke vyhladenie a vysokú citlivosť na šum či jednotlivé body.
Prečo štandardizovať?
Príznak vo veľkých jednotkách by ovládol vzdialenosť.
Čo je kliatba rozmernosti?
Vo vysokých rozmeroch sa vzdialenosti zbližujú a lokálne susedstvo stráca význam.
Musí model uchovávať tréningové dáta?
Áno alebo ich indexovanú reprezentáciu, čo má súkromnostné aj pamäťové dôsledky.
Prihlásiť / registrovať