Ako premýšľa ChatGPT a moderné jazykové modely

Tokeny a ich význam

Začiatočník39 min čítania38 častíZadarmo po registrácii
Lekcia02
TokenizáciaText sa mení na menšie jednotky
01Umelá
02inteli
03gencia
04→ ID tokenov

Model nečíta celé slová presne tak ako človek.

Jazykový model nepracuje priamo so slovami ani znakmi tak, ako ich vidí človek. Text najprv rozdelí tokenizer na jednotky, ktoré ovplyvňujú cenu, dĺžku kontextu aj správanie v rôznych jazykoch.

Po prečítaní budete vedieť

  • vysvetliť, čo je token a tokenizácia
  • odhadnúť vplyv tokenov na kontext a cenu
  • rozpoznať, prečo sa tokenizácia líši medzi jazykmi a modelmi
Zadarmo po registrácii

Celá kapitola je zadarmo po registrácii.

Jazykový model nepracuje priamo so slovami ani znakmi tak, ako ich vidí človek. Text najprv rozdelí tokenizer na jednotky, ktoré ovplyvňujú cenu, dĺžku kontextu aj správanie v rôznych jazykoch.

Keď človek napíše do chatbota vetu, vidí slová, medzery a interpunkciu. Jazykový model však nedostáva túto vetu v rovnakej podobe. Medzi textovým rozhraním a neurónovou sieťou stojí tokenizér: algoritmus a slovník, ktoré reťazec prevedú na postupnosť celých čísel. Každé číslo označuje položku v konečnom slovníku modelu. Až tieto identifikátory sa mapujú na vektory a vstupujú do transformerových vrstiev. Token môže predstavovať celé časté slovo, časť slova, interpunkčné znamienko, medzeru spolu s nasledujúcim výrazom, niekoľko bajtov alebo špeciálny riadiaci symbol. Rovnaké napísané slovo sa môže v rôznych tokenizéroch rozdeliť rozdielne. Dokonca aj v jednom tokenizéri môže mať jeho segmentácia inú podobu podľa toho, či stojí na začiatku vety, za medzerou alebo vedľa interpunkcie. Token preto nie je prirodzená jazyková konštanta. Je to rozhranie medzi textom a konkrétnym modelom. V kapitole 1 sme LLM definovali ako pravdepodobnostný model sekvencií. Táto kapitola spresňuje, z čoho je sekvencia zložená.

Ťažisko tvoria časti „Token nie je slovo, znak ani morféma“, „Od textu k číselným identifikátorom“ a „Unicode: prečo „jeden znak“ nemusí byť jedna jednotka“. Nejde iba o vysvetlenie pojmov. Kapitola ich prepája s rozhodnutiami, príkladmi a hranicami, ktoré treba poznať pri reálnom použití.

Po prečítaní budete vedieť vysvetliť, čo je token a tokenizácia a odhadnúť vplyv tokenov na kontext a cenu. Praktickým výsledkom bude schopnosť rozpoznať, prečo sa tokenizácia líši medzi jazykmi a modelmi.

Kapitola odpovedá aj na otázku „Je jeden token vždy jedno slovo?“ Nie. Token môže byť celé krátke slovo, časť slova, interpunkcia alebo iný textový fragment. Rozdelenie určuje konkrétny tokenizer.

38odborných častí
39minút čítania
23odkazov na zdroje
V plnej kapitole nájdete
  1. Token nie je slovo, znak ani morféma
  2. Od textu k číselným identifikátorom
  3. Unicode: prečo „jeden znak“ nemusí byť jedna jednotka
  4. Normalizácia: rovnaký vzhľad, rozdielny reťazec
  5. Prečo nepoužiť iba celé slová
  6. Prečo nepoužiť iba písmená alebo bajty
  7. Subword tokeny ako praktický kompromis
  8. Byte Pair Encoding krok za krokom
Registrovať sa alebo prihlásiť

Prihlásenie zabezpečuje ChatGPT. PoznAI nedostane vaše heslo.

Praktické odpovede

Často kladené otázky

Je jeden token vždy jedno slovo?

Nie. Token môže byť celé krátke slovo, časť slova, interpunkcia alebo iný textový fragment. Rozdelenie určuje konkrétny tokenizer.

Prečo sú tokeny dôležité pre cenu?

Mnohé API účtujú spracované vstupné a výstupné tokeny. Dlhší kontext a odpoveď preto zvyčajne zvyšujú náklady.

Prečo môže slovenčina používať viac tokenov?

Tokenizer je vytvorený podľa rozdelenia znakov a slov v tréningových dátach. Morfológia a nižšie zastúpenie jazyka môžu viesť k jemnejšiemu deleniu slov.