Presná definícia
Čo znamená zložitosť vzorky?
Zložitosť vzorky je počet nezávislých tréningových príkladov potrebný na dosiahnutie určenej presnosti a pravdepodobnosti úspechu pre danú triedu hypotéz, algoritmus a predpoklady o dátach. V teórii sa vyjadruje hranicou závislou od tolerovanej chyby, spoľahlivosti a kapacity, napríklad VC dimenzie. Nie je to univerzálne minimálne číslo riadkov; šum, závislosti a posun menia efektívnu informáciu vzorky.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Pri plánovaní zberu sa najprv stanoví, akú chybu a neistotu treba dosiahnuť v celej populácii aj kritických skupinách. Teoretická hranica poskytne rád alebo konzervatívny strop, pilotné krivky učenia zase empirický odhad prírastku. Opakované záznamy jedného subjektu sa nepočítajú ako rovnocenné nezávislé príklady a pri zriedkavej triede sa plánuje jej absolútny počet. Ak nový zber mení populáciu, nejde iba o väčšie n. Rozhodnutie kombinuje očakávaný pokles chyby, cenu označenia a riziko, že modelová trieda či cieľ sú zvolené nesprávne.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Od čoho zložitosť vzorky závisí?
Od presnosti, spoľahlivosti, kapacity triedy, šumu a predpokladov učenia.
Ako do nej vstupuje VC dimenzia?
Vyššia VC dimenzia typicky zvyšuje počet príkladov v PAC hraniciach.
Je každý riadok jeden príklad informácie?
Nie, duplicity a závislé merania znižujú efektívnu veľkosť.
Je teoretická hranica presná požiadavka?
Často je konzervatívna a platí iba za uvedených predpokladov.
Ako pomôže krivka učenia?
Ukáže empirický trend výkonu s rastúcim počtom relevantných dát.
Prihlásiť / registrovať