Presná definícia
Čo znamená textový dataset?
Textový dataset je verziovaná kolekcia dokumentov alebo úsekov so známym jazykom, zdrojom, licenciou, segmentáciou a prípadnými anotáciami. Tokeny vznikajú až po konkrétnej normalizácii a tokenizácii; rovnaký text môže mať viac reprezentácií.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Redakcia vytvorí korpus článkov s dátumom, rubrikou, autorstvom a licenciou. Citácie a prebraté správy deduplikuje podľa obsahu a test rozdelí podľa času, aby prepis tej istej udalosti nebol v tréningu aj teste.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje textový dataset?
Čistiace a segmentačné pravidlá prevedú dokumenty na jednotky, ktoré tokenizér mapuje na identifikátory pre model.
Kedy má textový dataset praktický význam?
Redakcia vytvorí korpus článkov s dátumom, rubrikou, autorstvom a licenciou.
S čím si pojem nezamieňať?
Textový dataset je obsahová kolekcia; korpus môže byť širší archív bez cieľovej úlohy a pripraveného rozdelenia.
Ako sa výsledok kontroluje?
Kontrolujú sa jazyky, kódovanie, licencie, osobné údaje, duplicity, dĺžky, zdrojové domény a únik medzi časťami.
Na čo si dať pozor?
Webový text môže obsahovať memorované osobné údaje, skryté šablóny a nevyvážené zastúpenie jazykov či názorov.
Prihlásiť / registrovať