Slovník výrazov AI/Zodpovedná AI a férovosť

Zodpovedná AI a férovosť

skreslenie datasetu

Anglický výraz dataset bias

základnéheslo č. 10685 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená skreslenie datasetu?

Skreslenie datasetu je systematický nesúlad medzi dátovou kolekciou a populáciou, javom alebo použitím, ktoré má reprezentovať. Vzniká výberom zdrojov, pokrytím, anotáciou, historickým procesom aj filtrami a prenáša sa do učenia i hodnotenia.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Dataset reči obsahuje prevažne štúdiové nahrávky jedného regiónu. Tím zdokumentuje pokrytie, doplní reálne hlučné prostredia a oddelene zmeria výkon podľa dialektu a zariadenia.

Overiteľnosť

Odborné zdroje

  1. Barocas, Hardt & Narayanan - Fairness and Machine Learningfairmlbook.org
  2. NIST - AI Risk Management Framework 1.0doi.org

Praktické odpovede

Často kladené otázky

Čo presne znamená skreslenie datasetu?

Skreslenie datasetu je systematický nesúlad medzi dátovou kolekciou a populáciou, javom alebo použitím, ktoré má reprezentovať.

Kedy sa skreslenie datasetu používa?

Dataset reči obsahuje prevažne štúdiové nahrávky jedného regiónu.

Od čoho treba skreslenie datasetu odlíšiť?

Sampling bias je konkrétny mechanizmus výberu; dataset bias je širší výsledný problém celej kolekcie.

Ako sa skreslenie datasetu kontroluje?

Porovná sa cieľová a dátová populácia, zdroje, chýbanie, anotátori, čas, segmenty a výkon pri externom teste.

Aké obmedzenie má skreslenie datasetu?

Väčší dataset nemusí byť menej skreslený, ak iba rozmnoží ten istý obmedzený zdroj alebo historickú selekciu.