Slovník výrazov AI/Veľké jazykové modely

Veľké jazykové modely

tokenizácia podslov

Anglický výraz subword tokenization

základnéheslo č. 4625 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená tokenizácia podslov?

Tokenizácia podslov rozkladá text na jednotky medzi znakom a slovom, aby časté tvary zostali kompaktné a zriedkavé slová sa dali poskladať z menších častí. Slovník sa učí z korpusu napríklad BPE, WordPiece alebo unigramovým modelom. Hranice závisia od dát, normalizácie a algoritmu, nie od slovenskej morfológie.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Je štandardom pri LLM a strojovom preklade, pretože zvládne nové mená a ohýbanie s pevným slovníkom. Pri výbere sa porovnáva priemerná dĺžka pre slovenčinu a ďalšie jazyky, konzistentnosť čísel a kódu a správanie pri preklepoch. Nerovnomerný tokenový rozpočet môže znevýhodniť používateľov niektorých jazykov.

Overiteľnosť

Odborné zdroje

  1. Neural Machine Translation of Rare Words with Subword Unitsaclanthology.org
  2. SentencePiece: A Simple and Language Independent Subword Tokenizeraclanthology.org

Praktické odpovede

Často kladené otázky

Ako funguje tokenizácia podslov?

Algoritmus vyberie postupnosť naučených fragmentov, ktoré pokryjú normalizovaný reťazec, a každému fragmentu priradí ID.

Kedy má tokenizácia podslov praktický význam?

Je štandardom pri LLM a strojovom preklade, pretože zvládne nové mená a ohýbanie s pevným slovníkom.

S čím si pojem nezamieňať?

Tokenizácia na úrovni bajtov garantuje pokrytie cez 256 základných bajtov; podslová môžu byť definované nad znakmi alebo bajtmi.

Ako sa výsledok kontroluje?

Kontroluje sa počet tokenov na slovo a znak, miera neznámych jednotiek, segmentácia odborných výrazov a výkon následnej úlohy.

Na čo si dať pozor?

Fragmentácia môže oddeliť znamienko od čísla, rozdeliť mená neintuitívne a zvýšiť náklady pre jazyky slabo zastúpené v korpuse.