Presná definícia
Čo znamená tokenizácia podslov?
Tokenizácia podslov rozkladá text na jednotky medzi znakom a slovom, aby časté tvary zostali kompaktné a zriedkavé slová sa dali poskladať z menších častí. Slovník sa učí z korpusu napríklad BPE, WordPiece alebo unigramovým modelom. Hranice závisia od dát, normalizácie a algoritmu, nie od slovenskej morfológie.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Je štandardom pri LLM a strojovom preklade, pretože zvládne nové mená a ohýbanie s pevným slovníkom. Pri výbere sa porovnáva priemerná dĺžka pre slovenčinu a ďalšie jazyky, konzistentnosť čísel a kódu a správanie pri preklepoch. Nerovnomerný tokenový rozpočet môže znevýhodniť používateľov niektorých jazykov.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje tokenizácia podslov?
Algoritmus vyberie postupnosť naučených fragmentov, ktoré pokryjú normalizovaný reťazec, a každému fragmentu priradí ID.
Kedy má tokenizácia podslov praktický význam?
Je štandardom pri LLM a strojovom preklade, pretože zvládne nové mená a ohýbanie s pevným slovníkom.
S čím si pojem nezamieňať?
Tokenizácia na úrovni bajtov garantuje pokrytie cez 256 základných bajtov; podslová môžu byť definované nad znakmi alebo bajtmi.
Ako sa výsledok kontroluje?
Kontroluje sa počet tokenov na slovo a znak, miera neznámych jednotiek, segmentácia odborných výrazov a výkon následnej úlohy.
Na čo si dať pozor?
Fragmentácia môže oddeliť znamienko od čísla, rozdeliť mená neintuitívne a zvýšiť náklady pre jazyky slabo zastúpené v korpuse.
Prihlásiť / registrovať