Dáta pre AI

textový dataset

Anglický výraz text dataset

pokročiléheslo č. 9305 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená textový dataset?

Textový dataset je verziovaná kolekcia dokumentov alebo úsekov so známym jazykom, zdrojom, licenciou, segmentáciou a prípadnými anotáciami. Tokeny vznikajú až po konkrétnej normalizácii a tokenizácii; rovnaký text môže mať viac reprezentácií.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Redakcia vytvorí korpus článkov s dátumom, rubrikou, autorstvom a licenciou. Citácie a prebraté správy deduplikuje podľa obsahu a test rozdelí podľa času, aby prepis tej istej udalosti nebol v tréningu aj teste.

Overiteľnosť

Odborné zdroje

  1. Bender & Friedman - Data Statements for NLPaclanthology.org
  2. Gebru et al. - Datasheets for Datasetsarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje textový dataset?

Čistiace a segmentačné pravidlá prevedú dokumenty na jednotky, ktoré tokenizér mapuje na identifikátory pre model.

Kedy má textový dataset praktický význam?

Redakcia vytvorí korpus článkov s dátumom, rubrikou, autorstvom a licenciou.

S čím si pojem nezamieňať?

Textový dataset je obsahová kolekcia; korpus môže byť širší archív bez cieľovej úlohy a pripraveného rozdelenia.

Ako sa výsledok kontroluje?

Kontrolujú sa jazyky, kódovanie, licencie, osobné údaje, duplicity, dĺžky, zdrojové domény a únik medzi časťami.

Na čo si dať pozor?

Webový text môže obsahovať memorované osobné údaje, skryté šablóny a nevyvážené zastúpenie jazykov či názorov.