Slovník výrazov AI/Veľké jazykové modely

Veľké jazykové modely

tokenizácia na úrovni bajtov

Anglický výraz byte-level tokenization

základnéheslo č. 4665 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená tokenizácia na úrovni bajtov?

Tokenizácia na úrovni bajtov reprezentuje UTF-8 text pomocou základných bajtových hodnôt a často nad nimi učí BPE zlúčenia. Základ 256 symbolov dokáže zakódovať ľubovoľnú postupnosť bajtov bez neznámeho znaku, no jeden Unicode znak môže zaberať viac bajtov a jeho hranica nemusí byť hranicou tokenu.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Je vhodná pre viacjazyčný text, kód a neobvyklé symboly, kde je dôležité úplné pokrytie. Pri rozpočte kontextu sa meria skutočný počet tokenov pre diakritiku, emoji a ne-latinské písma. Implementácia musí dekódovať iba platné bajtové sekvencie a ošetriť neviditeľné či riadiace znaky.

Overiteľnosť

Odborné zdroje

  1. Language Models are Unsupervised Multitask Learnerscdn.openai.com
  2. SentencePiece: A Simple and Language Independent Subword Tokenizeraclanthology.org

Praktické odpovede

Často kladené otázky

Ako funguje tokenizácia na úrovni bajtov?

Text sa prevedie do UTF-8 bajtov, tie sa mapujú na základné symboly a voliteľné zlúčenia spoja časté bajtové postupnosti do väčších tokenov.

Kedy má tokenizácia na úrovni bajtov praktický význam?

Je vhodná pre viacjazyčný text, kód a neobvyklé symboly, kde je dôležité úplné pokrytie.

S čím si pojem nezamieňať?

Znaková tokenizácia rešpektuje Unicode code point alebo grafému; bajtová pracuje nižšie a tým získava úplné pokrytie za cenu dlhších sekvencií.

Ako sa výsledok kontroluje?

Testuje sa každý bajt, poškodené UTF-8 vstupy, round trip, dĺžka po skriptoch a správanie medzier a riadiacich znakov.

Na čo si dať pozor?

Niektoré jazyky spotrebujú viac tokenov, rozdelenie môže preťať znak a neviditeľné bajtové varianty môžu obísť povrchové textové pravidlá.