Model nečíta celé slová presne tak ako človek.
Jazykový model nepracuje priamo so slovami ani znakmi tak, ako ich vidí človek. Text najprv rozdelí tokenizer na jednotky, ktoré ovplyvňujú cenu, dĺžku kontextu aj správanie v rôznych jazykoch.
Po prečítaní budete vedieť
- vysvetliť, čo je token a tokenizácia
- odhadnúť vplyv tokenov na kontext a cenu
- rozpoznať, prečo sa tokenizácia líši medzi jazykmi a modelmi
Celá kapitola je zadarmo po registrácii.
- Token nie je slovo, znak ani morféma
- Od textu k číselným identifikátorom
- Unicode: prečo „jeden znak“ nemusí byť jedna jednotka
- Normalizácia: rovnaký vzhľad, rozdielny reťazec
- Prečo nepoužiť iba celé slová
- Prečo nepoužiť iba písmená alebo bajty
- Subword tokeny ako praktický kompromis
- Byte Pair Encoding krok za krokom
Prihlásenie zabezpečuje ChatGPT. PoznAI nedostane vaše heslo.
Praktické odpovede
Často kladené otázky
Je jeden token vždy jedno slovo?
Nie. Token môže byť celé krátke slovo, časť slova, interpunkcia alebo iný textový fragment. Rozdelenie určuje konkrétny tokenizer.
Prečo sú tokeny dôležité pre cenu?
Mnohé API účtujú spracované vstupné a výstupné tokeny. Dlhší kontext a odpoveď preto zvyčajne zvyšujú náklady.
Prečo môže slovenčina používať viac tokenov?
Tokenizer je vytvorený podľa rozdelenia znakov a slov v tréningových dátach. Morfológia a nižšie zastúpenie jazyka môžu viesť k jemnejšiemu deleniu slov.
Prihlásiť / registrovať