Presná definícia
Čo znamená tokenizácia?
Tokenizácia je rozdelenie a zakódovanie vstupu na tokeny, s ktorými pracuje model. Pri moderných LLM typicky zahŕňa Unicode normalizáciu, segmentáciu na podslová alebo bajty a mapovanie na ID. Nie je to neutrálna príprava: určuje dĺžku sekvencie, hranice reprezentácie a to, ktoré textové vzory model zdieľa medzi slovami a jazykmi.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Pred spracovaním dokumentu sa tokenizáciou odhadne, či sa zmestí do kontextu a kde ho deliť. Tím meria tokeny na slovo pre slovenčinu, názvy, tabuľky a kód a zachováva hranice viet či odsekov pri chunkingu. Logy majú chrániť pôvodný text aj tokenové ID, ktoré môžu niesť citlivý obsah.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje tokenizácia?
Algoritmus hľadá postupnosť položiek slovníka pokrývajúcu normalizovaný vstup a vráti ich identifikátory v presnom poradí.
Kedy má tokenizácia praktický význam?
Pred spracovaním dokumentu sa tokenizáciou odhadne, či sa zmestí do kontextu a kde ho deliť.
S čím si pojem nezamieňať?
Tokenizácia podslov je jedna rodina tokenizácie; všeobecný proces môže používať celé slová, znaky, bajty alebo multimodálne jednotky.
Ako sa výsledok kontroluje?
Kontroluje sa reverzibilita, kompresný pomer, neznáme tokeny, stabilita normalizácie a distribúcia dĺžok pre cieľové jazyky.
Na čo si dať pozor?
Nevhodné hranice zvyšujú počet krokov a môžu štiepiť mená či čísla; neviditeľné Unicode rozdiely môžu viesť k odlišnému zakódovaniu.
Prihlásiť / registrovať