Slovník výrazov AI/Veľké jazykové modely

Veľké jazykové modely

tokenizácia

Anglický výraz tokenization

základnéheslo č. 4605 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená tokenizácia?

Tokenizácia je rozdelenie a zakódovanie vstupu na tokeny, s ktorými pracuje model. Pri moderných LLM typicky zahŕňa Unicode normalizáciu, segmentáciu na podslová alebo bajty a mapovanie na ID. Nie je to neutrálna príprava: určuje dĺžku sekvencie, hranice reprezentácie a to, ktoré textové vzory model zdieľa medzi slovami a jazykmi.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pred spracovaním dokumentu sa tokenizáciou odhadne, či sa zmestí do kontextu a kde ho deliť. Tím meria tokeny na slovo pre slovenčinu, názvy, tabuľky a kód a zachováva hranice viet či odsekov pri chunkingu. Logy majú chrániť pôvodný text aj tokenové ID, ktoré môžu niesť citlivý obsah.

Overiteľnosť

Odborné zdroje

  1. SentencePiece: A Simple and Language Independent Subword Tokenizeraclanthology.org
  2. Language Models are Unsupervised Multitask Learnerscdn.openai.com

Praktické odpovede

Často kladené otázky

Ako funguje tokenizácia?

Algoritmus hľadá postupnosť položiek slovníka pokrývajúcu normalizovaný vstup a vráti ich identifikátory v presnom poradí.

Kedy má tokenizácia praktický význam?

Pred spracovaním dokumentu sa tokenizáciou odhadne, či sa zmestí do kontextu a kde ho deliť.

S čím si pojem nezamieňať?

Tokenizácia podslov je jedna rodina tokenizácie; všeobecný proces môže používať celé slová, znaky, bajty alebo multimodálne jednotky.

Ako sa výsledok kontroluje?

Kontroluje sa reverzibilita, kompresný pomer, neznáme tokeny, stabilita normalizácie a distribúcia dĺžok pre cieľové jazyky.

Na čo si dať pozor?

Nevhodné hranice zvyšujú počet krokov a môžu štiepiť mená či čísla; neviditeľné Unicode rozdiely môžu viesť k odlišnému zakódovaniu.