Slovník výrazov AI/Základy strojového učenia

Základy strojového učenia

zložitosť vzorky

Anglický výraz sample complexity

špecializovanéheslo č. 985 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená zložitosť vzorky?

Zložitosť vzorky je počet nezávislých tréningových príkladov potrebný na dosiahnutie určenej presnosti a pravdepodobnosti úspechu pre danú triedu hypotéz, algoritmus a predpoklady o dátach. V teórii sa vyjadruje hranicou závislou od tolerovanej chyby, spoľahlivosti a kapacity, napríklad VC dimenzie. Nie je to univerzálne minimálne číslo riadkov; šum, závislosti a posun menia efektívnu informáciu vzorky.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri plánovaní zberu sa najprv stanoví, akú chybu a neistotu treba dosiahnuť v celej populácii aj kritických skupinách. Teoretická hranica poskytne rád alebo konzervatívny strop, pilotné krivky učenia zase empirický odhad prírastku. Opakované záznamy jedného subjektu sa nepočítajú ako rovnocenné nezávislé príklady a pri zriedkavej triede sa plánuje jej absolútny počet. Ak nový zber mení populáciu, nejde iba o väčšie n. Rozhodnutie kombinuje očakávaný pokles chyby, cenu označenia a riziko, že modelová trieda či cieľ sú zvolené nesprávne.

Overiteľnosť

Odborné zdroje

  1. MIT · Learnability and VC Dimensiongradml.mit.edu
  2. Shalev-Shwartz & Ben-David · Understanding MLcs.huji.ac.il

Praktické odpovede

Často kladené otázky

Od čoho zložitosť vzorky závisí?

Od presnosti, spoľahlivosti, kapacity triedy, šumu a predpokladov učenia.

Ako do nej vstupuje VC dimenzia?

Vyššia VC dimenzia typicky zvyšuje počet príkladov v PAC hraniciach.

Je každý riadok jeden príklad informácie?

Nie, duplicity a závislé merania znižujú efektívnu veľkosť.

Je teoretická hranica presná požiadavka?

Často je konzervatívna a platí iba za uvedených predpokladov.

Ako pomôže krivka učenia?

Ukáže empirický trend výkonu s rastúcim počtom relevantných dát.