AI nepozná svet ľudským spôsobom - počíta pravdepodobný výsledok.
LLM je model pravdepodobností nad tokenmi, nie encyklopédia ani databáza viet. Jeho užitočnosť vzniká zo schopnosti zachytiť vzory jazyka a prispôsobiť ich aktuálnemu kontextu.
Po prečítaní budete vedieť
- vysvetliť základný cieľ veľkého jazykového modelu
- odlíšiť model, chatbot a širší AI produkt
- pomenovať dôvody plynulosti aj faktických zlyhaní
- Large Language Model je veľký neurónový model, ktorý sa z rozsiahlych dát učí pravdepodobnostnú štruktúru jazykových sekvencií a následne ju využíva na spracovanie alebo generovanie tokenov.
- Moderné LLM sú väčšinou založené na architektúre Transformer, predtrénované self-supervised spôsobom a adaptované na množstvo úloh pomocou pokynov, príkladov či dodatočného tréningu.
- LLM nie je chatbot, databáza, vyhľadávač ani ľudská myseľ; je výpočtovým komponentom širšieho systému, ktorého správanie určujú aj dáta, nástroje, rozhranie a pravidlá.
Skratka LLM pochádza z anglického Large Language Model, teda veľký jazykový model. Názov pôsobí jednoducho, no každé jeho slovo skrýva odbornú otázku. Čo znamená „veľký“, ak neexistuje trvalá hranica počtu parametrov? Čo presne modeluje „jazyk“? A prečo hovoríme o „modeli“, keď používateľ vidí konverzačného asistenta, ktorý vyhľadáva na webe, analyzuje obraz a niekedy vykonáva akcie?
Najpresnejšia krátka odpoveď znie: LLM je parametrický pravdepodobnostný model sekvencií, zvyčajne realizovaný hlbokou neurónovou sieťou. Počas predtréningu spracúva veľké množstvo tokenizovaného textu a optimalizuje parametre tak, aby lepšie predikoval chýbajúce alebo nasledujúce tokeny. Tým si vytvára distribuované reprezentácie jazykových pravidelností, faktických asociácií, štýlov, kódu a časti štruktúry sveta zachytenej v dátach.
Táto formulácia je technicky triezva, ale nevysvetľuje celý jav. Model s jednoduchým tréningovým cieľom dokáže po dostatočne širokom predtréningu sumarizovať, prekladať, klasifikovať, odpovedať na otázky, generovať programový kód a pracovať s príkladmi vloženými do promptu. Zároveň môže vytvárať nepravdivé tvrdenia, zlyhávať pri malej zmene formulácie alebo reprodukovať skreslenia dát. Schopnosť a spoľahlivosť preto nie sú totožné.
Kapitola vytvorí spoločný slovník pre celú tému. Podrobná tokenizácia príde v kapitole 2, tréning v kapitole 3, halucinácie v kapitole 4, kontext v kapitole 5 a samotný proces generovania v kapitole 11. Všeobecné rozdiely medzi modelom a inteligenciou už vysvetlila prvá téma v kapitole 2.
Definícia v jednej technickej vete
- LLM odhaduje pravdepodobnostné rozdelenie tokenu alebo sekvencie podmienenej kontextom.
- Jeho parametre sa učia optimalizáciou stratovej funkcie na veľkom korpuse, nie ručným zapísaním všetkých jazykových pravidiel.
- Po predtréningu možno rovnaký základ adaptovať na rozličné úlohy bez vytvorenia samostatného modelu pre každú z nich.
Pri autoregresívnom jazykovom modeli možno pravdepodobnosť sekvencie tokenov (x_1, x_2, ..., x_n) rozložiť podľa reťazového pravidla:
P(x₁, ..., xₙ) = ∏ P(xₜ | x₁, ..., xₜ₋₁).
Model teda pri každej pozícii odhaduje distribúciu ďalšieho tokenu na základe predchádzajúceho kontextu. Počas tréningu pozná správny ďalší token z dát a upravuje parametre tak, aby mu priradil vyššiu pravdepodobnosť. Počas generovania správny token vopred neexistuje; dekódovací postup vyberá zo vzniknutej distribúcie a zvolený token pridá ku kontextu.
Nie všetky LLM používajú rovnaký cieľ. Model typu BERT sa učí rekonštruovať maskované tokeny s využitím kontextu z oboch strán a je prirodzene vhodný na reprezentáciu a porozumenie vstupu. Decoderové GPT modely používajú kauzálnu predikciu ďalšieho tokenu a prirodzene generujú pokračovanie. Encoder-decoder modely, napríklad T5, spracujú vstup encoderom a výstup tvoria decoderom. Taxonómia neznamená, že jedna vetva je univerzálne lepšia; architektúra a cieľ zodpovedajú rozdielnym použitiam.
Slovo „pravdepodobnostný“ neznamená, že systém iba náhodne vyberá slová bez štruktúry. Distribúcia je výsledkom miliárd naučených parametrov a konkrétneho kontextu. Náhodnosť alebo deterministickosť výberu je až ďalšia vrstva generovania. Aj vždy najpravdepodobnejší token môže viesť k nesprávnej odpovedi, pretože tréningový cieľ nie je totožný s overenou pravdou.
Čo znamená slovo „model“
- Model je matematická aproximácia vzťahov v dátach, nie kompletná kópia jazyka, sveta alebo ľudského poznania.
- Naučené parametre určujú transformáciu vstupných reprezentácií na pravdepodobnosti výstupu.
- Každý model má rozsah platnosti odvodený od dát, cieľa, architektúry a spôsobu hodnotenia.
Vo vede model zámerne zjednodušuje realitu. Mapa nie je územie a klimatický model nie je atmosféra. Jazykový model podobne neobsahuje každý komunikačný zámer, telesnú skúsenosť ani aktuálny stav sveta. Zachytáva štatistickú štruktúru pozorovanú v tréningových dátach a to, čo sa dá využiť cez jeho architektúru a tréningový cieľ.
Parametre sú numerické hodnoty - typicky váhy matíc a ďalšie naučené koeficienty. Jednotlivý parameter obvykle neznamená konkrétne slovo či fakt. Informácia je distribuovaná medzi veľa hodnôt a aktivácií. Preto nemožno jednoducho otvoriť parameter číslo 84 301 a prepísať v ňom dátum udalosti ako riadok databázy.
Model má aj hyperparametre a konštrukčné voľby, ktoré sa bežne neučia rovnakým spôsobom: počet vrstiev, rozmer reprezentácie, typ attention, dĺžku kontextu, tokenizer či tréningový rozvrh. Vývojári ich vyberajú experimentom, scaling analýzou a systémovými obmedzeniami.
Keď používateľ povie „model mi odpovedal“, môže mať na mysli celý produkt. Odborne treba rozlíšiť základný model, jeho post-training verziu, systémový prompt, retrieval, bezpečnostné filtre, nástroje a používateľské rozhranie. Rovnaké váhy sa v dvoch produktoch môžu správať odlišne. Rozdiel medzi artefaktom a systémom je centrálny aj v kapitole 10 prvej témy.
Čo znamená slovo „jazykový“
- Jazykový model sa učí distribúciu sekvencií reprezentovaných tokenmi, nie formálnu gramatiku ako jediný explicitný zoznam pravidiel.
- Textové dáta obsahujú nielen jazyk, ale aj fakty, názory, kód, štruktúru dokumentov, sociálne normy a chyby.
- Moderný LLM môže pracovať aj s kódom alebo tokenizovanými inými modalitami, no tým sa hranica pojmu jazykový model rozširuje.
Klasický language model priraďuje pravdepodobnosť slovám alebo sekvenciám. Dokáže napríklad odhadnúť, že po slovenskom spojení „hlavné mesto Slovenska je“ je pravdepodobnejší token spojený s Bratislavou než s oceánom. Moderný neurónový model nepoužíva iba krátke pevné n-gramové okolie; vytvára kontextové reprezentácie cez mnoho vrstiev.
Korpus je stopou ľudskej komunikácie, nie sterilnou učebnicou faktov. Webový text zahŕňa kvalitnú vedu, reklamu, fikciu, sarkazmus, zastarané tvrdenia, propagandu aj osobné údaje. Predikcia jazyka preto vedie model k naučeniu širokých pravidelností, ale sama neurčuje, ktorá veta je aktuálne pravdivá, etická alebo záväzná.
Programovací kód je tiež symbolická sekvencia s pravidlami a opakovanými štruktúrami. Model trénovaný na kóde môže dopĺňať funkcie a vysvetľovať chyby. Ak sa obraz rozdelí na vizuálne tokeny alebo sa jeho reprezentácia pripojí k jazykovému decoderu, systém pracuje multimodálne. Takéto modely podrobne rozoberie kapitola 8.
Nie každý foundation model je LLM. Model obrazu, molekúl či počasia môže byť veľký a všeobecne adaptovateľný bez toho, aby primárne modeloval jazyk. Stanford CRFM preto opisuje foundation models ako širšiu množinu a LLM ako významnú jazykovú podtriedu. Hranice sa rozmazávajú pri natívne multimodálnych systémoch, no pojmy sa nemajú používať ako úplné synonymá.
Čo znamená slovo „veľký“
- Neexistuje univerzálna a nadčasová vedecká hranica, od ktorej sa jazykový model automaticky stáva LLM.
- Veľkosť môže označovať počet parametrov, objem dát, tréningový výpočet, architektonickú kapacitu alebo organizačný rozsah vývoja.
- Počet parametrov sám nepredpovedá kvalitu, efektívnosť, kontextové okno ani vhodnosť pre konkrétnu úlohu.
Model so stovkami miliónov parametrov bol v jednom období považovaný za veľký; neskôr vznikli systémy s miliardami a stovkami miliárd parametrov. Pri mixture-of-experts navyše nie sú pri každom tokene aktívne všetky parametre. Porovnanie „model A má viac parametrov“ preto bez architektúry a tréningových dát má malú výpovednú hodnotu.
Scaling laws Kaplana a kolegov empiricky opísali pravidelné zlepšovanie tréningovej straty pri raste modelu, dát a výpočtov v sledovanom rozsahu. Práca o Chinchille neskôr ukázala, že pri pevnom rozpočte treba vyvážiť počet parametrov s množstvom tréningových tokenov. Menší, lepšie dotrénovaný model môže prekonať väčší nedotrénovaný model a byť lacnejší pri inferencii.
Akt EÚ o AI používa právny pojem general-purpose AI model, založený najmä na všeobecnosti a schopnosti vykonávať široký rozsah úloh. Recitál 98 uvádza miliardu parametrov ako jedno z vodidiel významnej všeobecnosti pri veľkom self-supervised tréningu, nejde však o univerzálnu vedeckú definíciu každého LLM ani o jedinú podmienku právnej klasifikácie.
Prakticky je vhodné chápať „large“ relatívne: model má dostatočnú kapacitu, dáta a výpočtový tréning na široký transfer a použitie cez prompty alebo adaptáciu. Vždy však treba uviesť konkrétne vlastnosti namiesto spoliehania sa na prídavné meno.
Od n-gramov k neurónovým jazykovým modelom
- Jazykové modelovanie je staršie než dnešné LLM a vychádza z pravdepodobnostného odhadu ďalšieho prvku sekvencie.
- N-gramové modely používajú obmedzenú históriu a počty výskytov; neurónové modely sa učia spojité reprezentácie a zdieľajú štatistickú silu medzi podobnými kontextmi.
- Moderný prelom vznikol spojením predtréningu, Transformera, rozsiahlych dát, akcelerátorov a transferu do mnohých úloh.
N-gramový model odhaduje pravdepodobnosť slova podľa predchádzajúcich (n-1) slov. Je transparentný a užitočný na vysvetlenie pravdepodobnosti, smoothingu a perplexity. Naráža však na riedkosť: väčšina dlhších kombinácií sa v tréningových dátach nikdy neobjaví a rastúce (n) dramaticky zväčšuje tabuľku.
Neurónový jazykový model mapuje symboly do hustých vektorov a používa naučenú funkciu. Podobné kontexty môžu zdieľať reprezentáciu aj bez identickej sekvencie. Rekurentné siete a LSTM spracúvali text postupne a udržiavali stav, no dlhé závislosti a sériový výpočet komplikovali škálovanie.
Transformer z roku 2017 nahradil hlavnú rekurentnú cestu self-attention mechanizmom a umožnil efektívnejšie paralelné spracovanie tréningových tokenov. BERT demonštroval silu bidirekcionálneho predtréningu pre reprezentáciu a GPT vetva silu generatívneho autoregresívneho predtréningu. Kapitola 12 prvej témy zasadzuje tieto zmeny do širšej histórie.
Kontinuita je rovnako dôležitá ako prelom. Moderný LLM stále optimalizuje jazykovú pravdepodobnosť a vyhodnocuje sa pojmami, ktoré majú korene v staršom NLP. Nová je mierka, architektúra, adaptabilita a spôsob, akým sa jeden model stáva základom veľkého počtu systémov.
Transformer ako dominantná architektúra
- Transformer vytvára kontextové reprezentácie pomocou self-attention, feed-forward blokov, reziduálnych spojení a normalizácie.
- Attention umožňuje každému tokenu vážiť relevantné pozície v povolenom kontexte a prenášať medzi nimi informáciu.
- Transformer je vysoko škálovateľný, no nie je synonymom LLM a jeho základný attention má významné pamäťové a výpočtové náklady.
Vstupné tokeny sa prevedú na vektory a doplní sa informácia o polohe. V každej transformerovej vrstve sa reprezentácie premieňajú cez attention a pozíciovo aplikovanú feed-forward sieť. Reziduálne spojenia zachovávajú cestu informácie a uľahčujú tréning hlbokého modelu; normalizácia stabilizuje aktivácie.
Self-attention vytvára pre token reprezentácie query, key a value. Podobnosť query s keys určuje váhy, ktorými sa kombinujú values. Multi-head attention vykonáva viac takýchto projekcií a umožňuje zachytiť rôzne typy vzťahov. Ide o naučený komunikačný mechanizmus medzi pozíciami, nie automaticky o ľudské „sústredenie pozornosti“ ani spoľahlivé vysvetlenie.
Pri kauzálnom decoderovom modeli maska zabráni pozícii vidieť budúce tokeny. Počas tréningu možno pravdepodobnosti pre veľa pozícií vypočítať paralelne, pretože skutočné predchádzajúce tokeny sú známe. Počas generovania vzniká ďalší token až po predchádzajúcom, takže decoding zostáva sekvenčný a využíva cache kľúčov a hodnôt.
Základný attention porovnáva páry pozícií, čo pri dlhom kontexte zvyšuje náklady približne kvadraticky. Moderné systémy používajú optimalizované kernely, grouped-query attention, riedke alebo lokálne varianty a ďalšie postupy. Dĺžku a využiteľnosť kontextu samostatne rozoberie kapitola 5.
Tokeny: jednotky, ktoré model skutočne spracúva
- Model neprijíma text priamo ako ľudské slová; tokenizer ho prevádza na identifikátory tokenov z konečného slovníka.
- Token môže byť celé slovo, časť slova, interpunkcia, medzera, bajtová sekvencia alebo špeciálny riadiaci symbol.
- Tokenizácia ovplyvňuje cenu, dĺžku kontextu, viacjazyčný výkon, prácu s číslami aj bezpečnostné správanie.
Používateľ napíše vetu, no prvou technickou operáciou býva normalizácia a tokenizácia. Časté jednotky môžu mať vlastný token, zriedkavé slovo sa rozdelí na menšie časti. Vďaka subword alebo byte-level postupom vie model reprezentovať aj nové slovo bez obrovského slovníka každého možného výrazu.
Token dostane celé číselné ID. Embedding tabuľka ho mapuje na spojitý vektor. Rovnaký token na vstupe začína rovnakým embeddingom, ale po prechode vrstvami vznikne kontextová reprezentácia odlišná podľa okolia. Slovo „zámok“ tak môže nadobudnúť inú internú reprezentáciu pri dverách a pri hrade.
Jazyk s menej efektívnou tokenizáciou potrebuje na rovnaký význam viac tokenov. Spotrebuje väčšiu časť kontextového okna a viac inferenčného výpočtu. Čísla alebo jednotlivé znaky sa môžu rozdeliť spôsobom, ktorý komplikuje presnú manipuláciu. Token nie je významová jednotka v lingvistickom zmysle.
Táto kapitola používa token iba ako základný pojem. Algoritmy tvorby slovníka, Unicode, slovenské príklady, token budget a dôsledky pre prompting vysvetlí kapitola 2.
Embeddings a distribuované reprezentácie
- Embedding mapuje diskrétny token do spojitého vektorového priestoru, v ktorom môže sieť vykonávať diferencovateľné operácie.
- Význam a funkcia nevznikajú v jednom vektore izolovane, ale v kontextovej transformácii cez vrstvy.
- Geometrická podobnosť odráža štatistické používanie v dátach a môže niesť užitočné vzťahy aj spoločenské stereotypy.
Počítačové ID tokenu 42 samo neobsahuje podobnosť s ID 43. Naučený embedding priradí každému tokenu vektor, ktorého súradnice sa optimalizujú spolu s modelom. Tokeny používané v podobných podmienkach môžu mať reprezentácie, ktoré umožňujú podobné transformácie.
Statický vstupný embedding však nie je konečným významom. Self-attention kombinuje okolie a každá vrstva vytvára novú reprezentáciu. Kontextové vektory môžu kódovať syntaktické, referenčné, tematické a ďalšie vlastnosti potrebné na predikciu. Výskum interpretability skúma, kde a ako sú vlastnosti reprezentované, no úplný čitateľný slovník parametrov nemáme.
Distribučná hypotéza spája význam slov s kontextami ich používania. Je mimoriadne produktívna pre NLP, ale štatistická podobnosť nie je automaticky ukotvená skúsenosťou ani komunikačným zámerom. Spor o formu a význam sa preto nedá uzavrieť peknou vizualizáciou vektorov.
Ak tréningové texty spájajú profesiu, skupinu alebo vlastnosť stereotypne, embeddingy a ďalšie reprezentácie môžu vzťah zachytiť. Post-training a filtre môžu obmedziť prejav, no základné dáta a kontext systému ostávajú relevantné. Reprezentácia je schopnosť aj nositeľ rizika.
Parametre, aktivácie a stav počas inferencie
- Parametre sú naučené a medzi bežnými požiadavkami sa nemenia; aktivácie vznikajú dočasne pri spracovaní konkrétneho vstupu.
- Prompt nevkladá nový fakt natrvalo do váh, ale ovplyvňuje aktuálny výpočet v kontextovom okne.
- Externá pamäť, história chatu a retrieval sú systémové vrstvy, ktoré sa nesmú zamieňať s parametrickou pamäťou modelu.
Po predtréningu sú váhy checkpointu fixné, kým ich ďalší tréning alebo explicitná úprava nezmení. Pri inferencii sa vstup propaguje cez sieť a vytvára aktivácie. Tie závisia od aktuálnych tokenov a po ukončení výpočtu samy osebe nepredstavujú trvalé učenie.
Ak používateľ v konverzácii vysvetlí nový pojem, model ho môže používať v ďalších odpovediach, kým je informácia v kontexte. To sa nazýva in-context adaptation alebo learning v behaviorálnom zmysle, nie aktualizácia parametrov gradientom. Po odstránení kontextu základný model novú informáciu nemá.
Aplikácia môže uložiť profil alebo históriu a pri ďalšej relácii ich znovu pripojiť. RAG vyhľadá dokument a vloží úryvok do promptu. Tak vzniká dojem pamäte, hoci ju implementuje databáza a orchestrace. Kapitola 7 podrobne oddelí retrieval od generovania.
Rozlíšenie je praktické pre súkromie a opravy. Vymazanie z histórie, z indexu a z tréningového datasetu sú tri odlišné operácie. Veta „model si to pamätá“ bez určenia vrstvy nedáva technicky jednoznačný význam.
Predtréning: učenie zo štruktúry samotných dát
- Predtréning používa rozsiahly korpus a všeobecný cieľ, z ktorého vzniknú prenositeľné jazykové reprezentácie.
- Self-supervised označuje situáciu, keď cieľový signál vzniká z dát samotných, napríklad posunutím sekvencie alebo maskovaním tokenu.
- Výsledkom je base model optimalizovaný na modelovanie dát, nie automaticky bezpečný a poslušný asistent.
Pri kauzálnom predtréningu vzniknú vstupné a cieľové tokeny z toho istého textu: vstupom je prefix a cieľom nasledujúci token. Nie je potrebné, aby človek ručne označil každú vetu odpoveďou. Táto self-supervised škálovateľnosť umožnila využívať omnoho väčšie množstvo textu než klasické úlohy s anotovanými štítkami.
Model minimalizuje priemernú cross-entropy loss medzi predikovanou distribúciou a skutočným tokenom. Gradient vypočíta, ako každý parameter prispel k chybe, a optimalizátor ho mierne zmení. Proces sa opakuje na obrovskom množstve batchov. Podrobnosti dátovej prípravy, distribuovaného tréningu, checkpointov a výpočtového rozpočtu patria do kapitoly 3.
Predtréning núti model stlačiť pravidelnosti potrebné na predikciu. Aby dobre pokračoval v texte, je užitočné zachytiť gramatiku, žáner, referencie, fakty, typické postupy aj štruktúru kódu. Neznamená to, že každý fakt je uložený presne alebo že optimalizácia rozlišuje pravdivé tvrdenie od často opakovanej chyby.
Slovo „self-supervised“ neznamená bez ľudí. Ľudia vytvorili obsah, zvolili zdroje, filtrovanie, tokenizer, cieľ, architektúru a infraštruktúru. Moderátori a anotátori môžu vstúpiť pri príprave dát a post-trainingu. Automatický vznik labelu je iba konkrétna technická vlastnosť učebného signálu.
Čítajte mapu od východiska cez súvislosť až po dôsledok. Spoločným jadrom je „Vstup → model → výstup“.
Base model, instruction model a chatbot
- Base model pokračuje v textovej distribúcii; instruction-tuned model je dodatočne prispôsobený na vykonávanie pokynov.
- Chatbot pridáva konverzačnú šablónu, systémové pravidlá, správu histórie, nástroje, bezpečnostné kontroly a rozhranie.
- Názov produktu preto neposkytuje úplnú informáciu o použitom modeli, verzii ani o všetkých komponentoch odpovede.
Ak base model dostane text „Otázka: Aké je hlavné mesto Slovenska? Odpoveď:“, môže pravdepodobne pokračovať správne, pretože rozpozná vzor. Nie je však vytrénovaný na konzistentnú rolu asistenta. Môže pokračovať ďalšou otázkou, napodobniť nežiaduci obsah alebo nerešpektovať formát.
Supervised instruction tuning používa príklady pokyn-odpoveď a učí model generovať želané reakcie. Preference tuning využíva ľudské alebo modelové porovnania odpovedí a optimalizuje správanie podľa zvolených preferencií. RLHF, DPO a príbuzné metódy sú rôzne technické cesty; ich mechanizmy a trade-offy rozoberie kapitola 6.
Chatová aplikácia formátuje roly system, user a assistant do konkrétnej sekvencie tokenov. Systémový pokyn definuje pravidlá, ale nie je nepreniknuteľnou bezpečnostnou hranicou. Orchestrátor môže pripojiť výsledok vyhľadávania, kalkulačku, kódové prostredie alebo pamäť. Výstup môže prejsť moderáciou či transformáciou.
Pre používateľa je preto presnejšie povedať: „Produkt vytvoril odpoveď pomocou určitej verzie modelu a ďalších komponentov.“ Pri audite treba vedieť, ktorý model, nastavenie, prompt, zdroj a nástroj sa použili. Hodnotenie samotného base modelu nevystihuje celý nasadený systém.
Post-training nemení základnú povahu modelu
- Dolaďovanie môže významne zmeniť správanie, formát, odmietanie a užitočnosť bez pretrénovania celého základu.
- Preference model odráža výber anotátorov, pravidlá a distribúciu hodnotených situácií, nie univerzálnu ľudskú hodnotu.
- Lepšie správanie v konverzácii neodstraňuje všetky faktické chyby ani limity predtréningových dát.
Práca InstructGPT ukázala, že modely prispôsobené ľudskej spätnej väzbe môžu byť používateľmi preferované pred väčším neprispôsobeným modelom. Post-training teda nie je kozmetika. Mení pravdepodobnosť odpovedí tak, aby model lepšie sledoval pokyn, uvádzal vhodný tón a odmietal vybrané nebezpečné požiadavky.
Anotátor však nemôže odborne overiť každú medicínsku, právnu a vedeckú odpoveď. Často hodnotí užitočnosť, jasnosť či dodržanie politiky. Model sa môže naučiť sycophancy - prispôsobovať sa názoru používateľa - alebo znieť istejšie, než zodpovedá dôkazom. Reward model je aproximácia ľudskej preferencie v konkrétnych dátach.
Post-training môže potlačiť nežiaduci výstup, ale znalostná alebo behaviorálna stopa môže zostať dostupná inou formuláciou. Bezpečnosť preto potrebuje evaluácie, architektonické oprávnenia a monitoring, nie iba dolaďovanie. Tému systematicky rozoberie kapitola 13.
Zmena správania môže mať aj vedľajšie účinky. Prílišné odmietanie zníži užitočnosť, optimalizácia stručnosti vynechá podmienku a preferencia plynulosti skryje neistotu. Post-training je viaccieľová optimalizácia s kompromismi, nie jednorazové „naučenie správnych hodnôt“.
Prompt a in-context learning
- Prompt je tokenizovaný kontext, ktorý podmieňuje distribúciu výstupu; nie je to telepatický prenos zámeru.
- Pokyn, príklady a relevantné údaje môžu vyvolať schopnosť bez aktualizácie parametrov.
- Citlivosť na poradie, formuláciu a rušivý kontext ukazuje, že in-context learning nie je stabilná náhrada tréningu ani validácie.
GPT-3 popularizoval few-shot hodnotenie: do promptu sa vloží niekoľko dvojíc vstup-výstup a model pokračuje podľa demonštrovaného vzoru. Pri zero-shot režime dostane iba pokyn. V oboch prípadoch sa počas bežnej inferencie váhy nemenia; zmena správania vzniká z aktivácií podmienených kontextom.
Príklad môže špecifikovať úlohu presnejšie než abstraktná veta. Súčasne môže preniesť chybu, neželaný štýl alebo skreslenie. Poradie možností v klasifikácii, názvy labelov a text okolo otázky môžu meniť výsledok. Preto sa prompt stáva verziovanou súčasťou systému a testuje sa na reprezentatívnej sade.
Prompt engineering nie je magická formulka. Kvalitný vstup definuje cieľ, zdroje, obmedzenia, výstupný formát a kritériá. Nemôže dodať modelu fakt, ktorý nie je v parametroch ani kontexte, a bezpečnostná veta nenahrádza technické oprávnenia.
Kontext má konečnú kapacitu a model ho nemusí využívať rovnomerne. Relevantná informácia môže byť prehliadnutá, protirečivý pokyn zneužiť správanie a dlhý dokument zvýšiť náklady. Mechaniku, efektívny token budget a problém „lost in the middle“ rozoberie kapitola 5.
Ako z distribúcie vznikne odpoveď
- Model pri jednom kroku vytvorí logits pre celý výstupný slovník a softmax ich prevedie na pravdepodobnosti.
- Dekódovací algoritmus zvolí token, pridá ho ku kontextu a proces opakuje až po koniec alebo limit.
- Greedy decoding, temperature, top-k a top-p menia výber, nie pravdivostný cieľ modelu.
Posledná reprezentácia aktuálnej pozície sa lineárnou projekciou mapuje na skóre každého tokenu slovníka. Softmax normalizuje skóre na distribúciu. Token s najvyššou pravdepodobnosťou môže byť interpunkcia, časť slova, kód alebo špeciálny koniec sekvencie.
Greedy decoding vždy zvolí najpravdepodobnejší token v danom kroku. Sampling vyberá podľa distribúcie, prípadne upravenej teplotou a obmedzenej na pravdepodobné jadro. Vyššia variabilita môže pomôcť tvorivosti a diverzite, ale ani nízka teplota negarantuje faktickosť. Deterministicky opakovaná halucinácia zostáva halucináciou.
Autoregresia znamená, že skorý token sa stane súčasťou vstupu pre ďalší krok. Malá odchýlka môže viesť k úplne inému pokračovaniu a model môže neskôr racionalizovať vlastný chybný predpoklad. Generovanie odpovede je trajektória, nie jednorazové načítanie hotového odseku.
Produkty môžu generovať viac kandidátov, použiť test-time compute, kritika, hlasovanie alebo verifikátor. Výslednú odpoveď tak nevytvorí jediný jednoduchý sampling. Detailný algoritmický pohľad prinesie kapitola 11.
Čo LLM počas predikcie „vie“
- Časť informácií je parametricky zachytená ako rozptýlené asociácie; nejde o katalóg s garantovaným pôvodom a aktuálnosťou.
- Vybavenie faktu závisí od formulácie, frekvencie, konfliktov v dátach a post-trainingu.
- Parametrická znalosť sa má pri náročných úlohách dopĺňať overiteľným externým zdrojom a kontrolou.
Model dokáže odpovedať na veľa faktických otázok bez databázy, pretože predikcia počas tréningu zvýhodnila reprezentácie pravidelných vzťahov. Často uvádzaný fakt v konzistentných kontextoch má väčšiu šancu na stabilné vybavenie. Vzácny, časovo premenlivý alebo konfliktný údaj sa môže rekonštruovať nesprávne.
Neexistuje natívny ukazovateľ „túto vetu som čerpal z dokumentu X“, ak systém dokument výslovne nepripojil. Model môže vytvoriť presnú citáciu, ale aj pravdepodobne vyzerajúci neexistujúci titul. Parametre komprimujú vzory a neuchovávajú spoľahlivú bibliografickú provenienciu každého výstupu.
Výraz „knowledge cutoff“ je zjednodušený opis hranice tréningových dát. Korpus môže mať rôzne časové rezy a starší fakt môže chýbať. Produkt môže mať webový nástroj a odpovedať aktuálne, ale aktuálnosť pochádza z retrievalu, nie zo zázračnej zmeny základných váh.
RAG v kapitole 7 pripojí vyhľadané zdroje ku kontextu. Znižuje niektoré faktické problémy a umožňuje citácie, no nezaručuje správne vyhľadanie ani interpretáciu. Kedy dôverovať výsledku, systematicky uzavrie kapitola 15.
Prečo jednoduchý cieľ vytvára široké schopnosti
- Predikcia ďalšieho tokenu je veľmi všeobecný cieľ, pretože kvalitná predikcia môže vyžadovať syntax, žáner, referencie, fakty a štruktúru úlohy.
- Široké dáta umožňujú prenos medzi úlohami, ktoré možno reprezentovať ako textové pokračovanie.
- Z pozorovanej schopnosti nemožno automaticky odvodiť rovnaký vnútorný proces, aký používa človek.
Ak má model pokračovať v matematickom riešení, musí zachytiť vzor postupu; pri kóde syntax a závislosti; pri dialógu roly a pragmatiku. Veľká kapacita a dáta umožnia vytvoriť reprezentácie použiteľné v mnohých kontextoch. Prompt potom úlohu „naprogramuje“ v prirodzenom jazyku bez zmeny architektúry.
Text navyše obsahuje opisy iných úloh a ich výsledky: učebnice, návody, diskusie, programy a príklady. Model sa nepripravuje iba na gramaticky možné vety, ale na distribúciu ľudských textových artefaktov. Z toho vzniká veľká praktická šírka.
Výkon je však jagged - nerovnomerný. Model vyrieši zložitú známu štruktúru a zlyhá na jednoduchej zmene alebo presnom počítaní. Plynulosť vytvára očakávanie všeobecnej konzistencie, ktorú tréningový cieľ negarantuje. Široká kompetencia nie je jednotná spoľahlivosť.
Keď model vytvorí vysvetlenie, text nemusí byť vernou introspekciou interného výpočtu. Chain-of-thought môže zlepšiť výkon, no generované odôvodnenie môže racionalizovať. Hĺbkové limity tejto formy „uvažovania“ budú témou kapitoly 12.
Scaling laws a vznik schopností
- Empirické scaling laws opisujú priemerné zlepšovanie určitej straty s modelom, dátami a výpočtom v konkrétnom rozsahu.
- Diskrétna metrika môže vytvoriť dojem náhleho emergence, aj keď podkladová pravdepodobnosť rastie plynule.
- Škálovanie nepredpovedá automaticky pravdivosť, bezpečnosť, agentnú spoľahlivosť, vedomie ani ekonomický prínos.
Scaling law je užitočný inžiniersky vzťah. Umožňuje odhadovať, ako sa cross-entropy zmení pri zväčšení rozpočtu a ako vyvážiť parametre a tréningové tokeny. Je empirický, závisí od architektúry, dát a rozsahu a môže sa meniť pri novom postupe.
Niektoré schopnosti sa na benchmarku objavia až od určitej veľkosti. Ak test hodnotí len správne/nesprávne, plynulé zvýšenie pravdepodobnosti prekročí prah a vyzerá ako skok. Inokedy môže model nadobudnúť novú použiteľnú kombináciu reprezentácií. Odborné tvrdenie potrebuje viac veľkostí, metrík, intervaly neistoty a kontrolu kontaminácie.
Škálovanie tréningovej straty nehovorí, či výstup nebude škodlivý alebo či dlhý agentný proces zvládne stovku krokov. Ekonomika navyše zahŕňa inferenčnú cenu, energiu, latenciu a ľudskú kontrolu. Preto „väčší“ nie je univerzálna produktová stratégia.
Termín emergent sa má používať opisne, nie mysticky. Nová schopnosť nevytvára dôkaz vedomia ani odchodu od matematického mechanizmu. Mýty o inteligencii a exponenciálnom pokroku podrobnejšie rozobrala kapitola 3 prvej témy.
Dense a mixture-of-experts modely
- Dense model aktivuje pri každom tokene v zásade všetky relevantné parametre každej vrstvy.
- Mixture-of-experts používa router, ktorý pre token vyberá podmnožinu expertných blokov, čím oddeľuje celkovú kapacitu od aktívneho výpočtu.
- Celkový a aktívny počet parametrov, kvalita routingu a komunikačné náklady treba pri porovnávaní uvádzať osobitne.
V bežnom dense transformeri prejde token rovnakou štruktúrou blokov. MoE nahradí niektoré feed-forward časti množinou expertov a router zvolí napríklad jedného alebo niekoľkých. Model môže mať vysokú celkovú kapacitu, kým jeden token použije iba časť parametrov.
Sparsita znižuje výpočet vzhľadom na celkový počet váh, ale nevytvára bezplatnú kapacitu. Všetky expertné váhy treba uložiť, router vyvažovať a tokeny komunikovať medzi zariadeniami. Nerovnomerné zaťaženie a latencia komplikujú prevádzku. Parameter count preto nie je porovnateľný bez označenia architektúry.
Slovo expert je technická metafora. Jednotlivý blok nemusí zodpovedať čitateľnej profesii a routing nie je vedomé privolanie odborníka. Špecializácia sa môže objaviť štatisticky, no interpretácia vyžaduje výskum.
MoE ukazuje, prečo definícia LLM nemôže stáť na jednom čísle. Dôležité sú tréningové tokeny, aktívny výpočet, architektúra, kvalita, pamäť a pracovný kontext.
LLM, foundation model, generatívna AI a GPAI
- LLM označuje jazykový model; foundation model zdôrazňuje široký predtréning a adaptáciu do downstream úloh.
- Generatívna AI je širšia kategória systémov produkujúcich nový obsah v rôznych modalitách.
- General-purpose AI model je okrem technického aj právny pojem, ktorého presné dôsledky určuje príslušný predpis.
Stanford CRFM definuje foundation model ako model trénovaný na širokých dátach, spravidla self-supervised vo veľkej mierke, ktorý možno adaptovať na široký rozsah úloh. LLM môže byť foundation modelom, ak plní túto funkciu. Úzko špecializovaný veľký jazykový model nemusí mať rovnakú downstream všeobecnosť.
Generatívna AI zahŕňa jazykové modely, difúzne obrazové modely, hudobné a video systémy. Nie každý generatívny model je LLM a nie každý LLM sa používa primárne na voľné generovanie; encoderový model môže vytvárať reprezentácie pre klasifikáciu.
Akt EÚ o AI odlišuje general-purpose AI model od general-purpose AI system. Recitál 97 výslovne upozorňuje, že model potrebuje ďalšie komponenty, napríklad používateľské rozhranie, aby tvoril systém. Právna definícia sleduje všeobecnosť a integráciu do množstva downstream aplikácií, nie marketingové označenie LLM.
Pojem frontier model označuje aktuálnu hranicu schopnosti alebo mierky, ale nemá jednu nadčasovú technickú definíciu. Open-weight zas hovorí o dostupnosti váh, nie automaticky o otvorených dátach a tréningovom kóde. Kapitola 9 vytvorí presnú taxonómiu otvorenosti.
Model nie je databáza, vyhľadávač ani kalkulačka
- Databáza uchováva explicitné záznamy, vyhľadávač vracia indexované zdroje a kalkulačka vykonáva definované operácie.
- LLM generuje pravdepodobné tokenové pokračovanie a môže napodobniť výsledok týchto nástrojov bez ich garancií.
- Spoľahlivý systém deleguje presnú podúlohu vhodnému nástroju a kontroluje, či model vytvoril správne volanie.
Databázový dotaz môže vrátiť aktuálny stav účtu s definovanou transakčnou konzistenciou. LLM môže zo vzoru vytvoriť číslo, ktoré vyzerá primerane, ale nemá prístup k účtu. Vyhľadávač poskytne URL a úryvok; model bez retrievalu môže vygenerovať názov zdroja ako jazykový vzor.
Pri aritmetike jazykový model niekedy využije naučené vzory a interný výpočet, no presnosť nie je rovnaká ako pri kalkulačke. S rastúcou dĺžkou čísla alebo netypickou úlohou sa chyba môže zvýšiť. Tool use umožní modelu zostaviť výraz, kalkulačke ho vypočítať a výsledok preložiť používateľovi.
Delegovanie nevyrieši všetko. Model môže zvoliť nesprávny nástroj, vytvoriť chybný SQL filter alebo zle interpretovať správny výsledok. Systém musí validovať argumenty, oprávnenia, schému a následnú vetu. Presný komponent znižuje konkrétny typ chyby, nie všetky.
Táto kompozícia je dôvodom, prečo sa moderné produkty nemajú hodnotiť iba ako „LLM“. RAG, agenti a multimodálne nástroje rozširujú schopnosť aj útočnú plochu. Model zostáva orchestrujúcim probabilistickým prvkom.
„Rozumie“ LLM jazyku?
- Odpoveď závisí od operačnej definície porozumenia: výkon na úlohe, vnútorná reprezentácia, ukotvenie, komunikačný zámer alebo vedomá skúsenosť nie sú to isté.
- LLM preukázateľne zachytáva bohaté jazykové pravidelnosti a dokáže ich funkčne použiť, no z toho nemožno bez ďalšieho odvodiť ľudský typ významu či vedomie.
- Odborný text má opisovať merateľnú schopnosť a podmienky namiesto metafyzického záveru z plynulého rozhovoru.
V bežnom jazyku povieme, že systém „rozumie pokynu“, keď ho správne vykoná. Táto behaviorálna skratka je praktická, ak nezabudneme na jej rozsah. Model môže správne klasifikovať vzťahy, preložiť neznámu vetu a odpovedať na otázku o texte. Také výsledky dokazujú funkčné reprezentácie užitočné pre jazykové úlohy.
Bender a Koller rozlišujú formu - pozorovateľnú jazykovú štruktúru - od významu ukotveného v komunikačnom zámere a vo svete. Tvrdia, že systém trénovaný iba na forme nemá sám osebe prístup k tomuto ukotveniu. Následný výskum diskutuje, koľko sémantickej štruktúry možno z distribúcie odvodiť a čo pridávajú multimodálne či interaktívne dáta. Spor nie je vyriešený jedným benchmarkom.
Moderné systémy navyše nemusia byť trénované iba na čistom texte. Obraz, zvuk, video, spätná väzba, nástroje a interakcia rozširujú zdroje signálu. Ani multimodalita však automaticky neposkytuje ľudské telo, sociálny život, vlastný dlhodobý cieľ alebo fenomenálne vedomie. Každú vlastnosť treba dokazovať osobitne.
Najbezpečnejší odborný jazyk znie: model reprezentuje, predikuje, rieši test, generalizuje v podmienkach alebo používatelia mu pripisujú určitú schopnosť. Vedomie a subjektívna skúsenosť nie sú pozorovateľným dôsledkom škálovania textovej pravdepodobnosti. Rozdiel medzi úzkou a všeobecnou AI rozobrala kapitola 5 prvej témy.
AI nepozná svet ľudským spôsobom - počíta pravdepodobný výsledok. Náčrt použite ako krátku kontrolu pred praktickým rozhodnutím.
Typické schopnosti LLM
- LLM vie generovať a transformovať text, klasifikovať, sumarizovať, prekladať, extrahovať štruktúru, odpovedať na otázky a pracovať s kódom.
- Výkon závisí od jazyka, domény, promptu, kontextu, post-trainingu, dostupných nástrojov a evaluačnej definície úspechu.
- Šírka schopností umožňuje jeden model použiť na mnoho úloh, ale nezaručuje odbornú autorizáciu ani konzistentnú kvalitu.
Generovanie zahŕňa návrh e-mailu, pokračovanie príbehu, vysvetlenie, štruktúrovaný JSON či programový kód. Transformácia mení štýl, dĺžku, jazyk alebo formát. Extrakcia mapuje text na entity, polia a kategórie. Otázky a odpovede môžu vychádzať z parametrov alebo z priloženého dokumentu.
LLM možno použiť ako flexibilné rozhranie k softvéru. Prirodzený jazyk sa prevedie na SQL, API argumenty alebo plán. Model môže vytvoriť testy, porovnať možnosti a sumarizovať výsledok nástroja. Také použitie je silnejšie než izolovaná konverzácia, ale vyžaduje validáciu a oprávnenia.
Schopnosť sa často prejaví bez explicitného tréningu na konkrétny downstream dataset. Few-shot príklady a pokyn nasmerujú existujúce reprezentácie. Fine-tuning môže zlepšiť konzistenciu a doménový štýl. RAG dodá aktuálne zdroje. Každá metóda rieši inú medzeru a pridáva vlastné riziko.
Výkon nie je rovnaký naprieč jazykmi a populáciami. Anglické benchmarky môžu skrývať slabšiu slovenčinu, dialekt alebo lokálne právo. Aj veľmi kvalitná sumarizácia všeobecného článku nič nehovorí o klinickom použití. Každý use case potrebuje vlastný dôkaz.
Typické limity už v samotnej definícii
- Tréningový cieľ pravdepodobného tokenu nie je cieľom pravdivosti, kauzálneho vysvetlenia ani bezpečnej akcie.
- Konečný kontext, statické váhy, nedokumentované dáta a autoregresívna kumulácia chýb vytvárajú štrukturálne obmedzenia.
- Limity možno zmierňovať nástrojmi, retrievalom, post-trainingom a kontrolou, no ich účinnosť sa musí merať.
Model môže halucinovať, pretože potrebuje pokračovať aj v oblasti, kde nemá spoľahlivý faktický základ. Môže byť nekalibrovaný a formulovať neistý odhad rovnako plynulo ako známy fakt. Kapitola 4 oddelí faktickú chybu, negrounded výstup, konfabuláciu citácie a nesúlad so zdrojom.
Kontextové okno je konečné a jeho nominálna dĺžka neznamená rovnomerné využitie. Parametre sa počas bežnej interakcie neaktualizujú. Model nevie automaticky, že dokument bol zrušený včera. Externé zdroje riešia aktuálnosť iba vtedy, ak sa správne nájdu, autorizujú a interpretujú.
Autoregresívna slučka podmieňuje ďalší krok vlastným predchádzajúcim výstupom. Pri dlhej úlohe sa chyby kumulujú. Agent môže nesprávne naplánovať alebo zavolať správny nástroj so zlým parametrom. Vyššia autonómia preto potrebuje prísnejšiu kontrolu než textový návrh.
Model nepozná organizačnú zodpovednosť. Môže generovať právne znejúcu radu, ale nemá licenciu ani povinnosť voči klientovi. Hranice schopností a spoločenského oprávnenia sú oddelené. Podrobné limity rozoberie kapitola 12.
LLM je súčasť sociotechnického systému
- Výstup vzniká zo spojenia technického artefaktu, dát, dodávateľa, používateľa, organizácie a inštitucionálnych pravidiel.
- Výkon a škoda sa nedajú úplne pripísať iba váham; význam má rozhranie, pracovný tlak, školenie, príjemca a následná akcia.
- Homogenizácia okolo jedného foundation modelu znižuje náklady a súčasne šíri jeho chyby do množstva downstream aplikácií.
Stanford CRFM použil slovo foundation aj preto, že jeden predtrénovaný základ napája veľa systémov. Downstream tím pridá vlastné dáta a rozhranie, no zdedí časť schopností a obmedzení. Aktualizácia upstream modelu môže zmeniť stovky služieb bez úpravy ich vlastného kódu.
Používateľské správanie mení výsledok. Človek môže modelu slepo dôverovať, ignorovať varovanie alebo ho používať mimo schváleného účelu. Organizácia môže stanoviť nereálny čas na kontrolu a následne označiť škodu za „ľudskú chybu“. Zodpovedná analýza skúma celý pracovný tok.
Tréningové dáta vznikli prácou autorov, kurátorov, moderátorov a anotátorov. Výpočtová infraštruktúra spotrebúva kapitál a energiu. Dostupnosť a kvalita sa líšia medzi jazykmi a regiónmi. LLM je preto ekonomický a politický artefakt rovnako ako matematický.
Kritika „stochastic parrots“ upozorňuje na environmentálne náklady, skreslenia, dokumentáciu dát a riziko zamieňania formy za význam. Metafora nevysvetľuje všetky interné schopnosti modelu, ale je relevantnou odbornou výzvou proti antropomorfizácii a nekritickému škálovaniu. Syntéza má brať vážne empirické úspechy aj sociotechnické náklady.
Výpočty, dáta a infraštruktúra
- Veľký predtréning vyžaduje akcelerátory, distribuovanú komunikáciu, úložisko, energetiku, tréningový softvér a tím rozličných odborností.
- Inferencia má vlastnú ekonomiku pamäte, priepustnosti, latencie, batchingu, dĺžky kontextu a počtu generovaných tokenov.
- Kompresia a menšie modely môžu znížiť náklady, no ich kvalitu a bezpečnosť treba hodnotiť na cieľovej úlohe.
Parameter býva počas tréningu a inferencie reprezentovaný určitým počtom bitov a potrebuje pamäť. Tréning navyše uchováva gradienty, stavy optimalizátora a aktivácie, takže spotreba výrazne presahuje samotné váhy. Model sa delí medzi zariadenia a výpadok jedného uzla musí systém zvládnuť checkpointom.
Pri inferencii sa váhy načítajú a pre každý vstup vykonajú maticové operácie. Dlhý prompt zväčšuje prefill, každý nový token autoregresívne pokračuje decodingom a KV cache rastie s kontextom. Cena za milión tokenov je produktová metrika, nie úplný opis energie ani kvality.
Kvantizácia používa nižšiu numerickú presnosť, distilácia učí menší model napodobniť väčší a pruning či sparsita redukujú časť výpočtu. Optimalizované servery spájajú požiadavky do batchov. Každá technika môže ovplyvniť zriedkavé schopnosti alebo kalibráciu, preto sa znovu testuje.
Infraštruktúrna náročnosť sústreďuje frontier vývoj do malého počtu organizácií a dodávateľských reťazcov, ako ukázala kapitola 13 prvej témy. Pre používateľa je dôležité, že „cloudový model“ nie je nehmotný: má cenu, dostupnosť, dátovú lokalitu a environmentálny kontext.
Ako sa LLM hodnotí
- Hodnotenie musí rozlišovať base model, post-trained model a nasadený systém a uvádzať prompt, nástroje, rozpočet a verziu.
- Perplexity meria kvalitu jazykovej distribúcie, downstream benchmark konkrétnu schopnosť a ľudské hodnotenie užitočnosť v zvolenom kontexte.
- Žiadna jedna metrika nezachytí pravdivosť, robustnosť, bezpečnosť, náklady, spravodlivosť a reálny výsledok súčasne.
Perplexity je exponenciálna transformácia priemernej cross-entropy a intuitívne opisuje, nakoľko je model „prekvapený“ testovou sekvenciou. Porovnateľnosť vyžaduje rovnaké dáta a tokenizáciu; modely s iným tokenizerom nemožno bez opatrnosti zoradiť podľa jedného čísla. Nižšia perplexity tiež nezaručuje lepšie správanie asistenta.
Benchmark kladie otázky z matematiky, kódu, vedomostí alebo uvažovania a vypočíta presnosť či inú metriku. Výsledok ovplyvňuje few-shot prompt, poradie odpovedí, počet pokusov a nástroje. Položky sa môžu dostať do tréningových dát a model sa môže optimalizovať na známe testy.
Stanford HELM presadzuje holistickejšie hodnotenie viacerých scenárov a metrík vrátane presnosti, kalibrácie, robustnosti, férovosti, skreslení, toxicity a efektívnosti. Ani široký akademický benchmark nenahrádza evaluačnú sadu konkrétnej nemocnice, firmy alebo jazyka.
Ľudia môžu preferovať plynulejšiu odpoveď, hoci je fakticky slabšia. Model-as-a-judge škáluje, ale môže zdieľať chyby a štýlové preferencie. Vysokorizikový use case potrebuje kvalifikovaného odborníka, meranie následku a monitoring po nasadení.
Praktický príklad: od otázky k systémovej odpovedi
- Jednoduchá používateľská veta prejde tokenizáciou, formátovaním, modelovým výpočtom, dekódovaním a často ďalšími kontrolami.
- Ak produkt používa retrieval alebo nástroj, odpoveď obsahuje výsledok viacerých komponentov, nie iba parametrickú znalosť LLM.
- Každý prechod vytvára samostatný bod kvality, bezpečnosti a zodpovednosti.
Používateľ napíše: „Zhrň aktuálne pravidlá našej cestovnej politiky do piatich bodov.“ Aplikácia identifikuje rolu, pridá systémové pravidlá a overí prístup. Retriever vyhľadá schválenú aktuálnu smernicu, rozdelí alebo vyberie pasáže a vloží ich do kontextu spolu s otázkou.
Tokenizer prevedie celú sekvenciu na ID. Model vypočíta kontextové reprezentácie a distribúciu prvého výstupného tokenu. Decoder vyberá tokeny až po koniec. Aplikácia môže overiť štruktúru, citácie alebo zakázané údaje a odpoveď zobrazí používateľovi.
Chyba môže vzniknúť pri identite, vyhľadaní starej smernice, rozdelení výnimky od pravidla, prehliadnutí pasáže modelom, generovaní alebo interpretácii používateľom. Veta „LLM sa pomýlil“ neidentifikuje príčinu. Potrebné sú logy, verzie a test každej vrstvy.
Ak model sumarizuje bez retrievalu, spolieha sa na všeobecné parametre a firemnú politiku nemôže spoľahlivo poznať. Ak retrieval pripojí zdroj, odpoveď je lepšie ukotvená, no používateľ stále overí citáciu. Tento príklad sa bude vracať v kapitolách o kontexte, RAG, generovaní, bezpečnosti a dôvere.
Čo sa pri LLM často zamieňa
- Tréning sa zamieňa s aktuálnou konverzáciou, kontext s trvalou pamäťou a plynulosť s faktickou istotou.
- Model sa zamieňa s produktom, počet parametrov s kvalitou a benchmark s reálnou službou.
- Technická schopnosť sa zamieňa s oprávnením, zodpovednosťou, vedomím alebo všeobecnou inteligenciou.
Model sa pri bežnom chate nepretrénuje každou opravou; aplikácia môže konverzáciu uložiť na budúce spracovanie, čo je iná otázka. Dlhý kontext nie je nekonečná pamäť a údaj v ňom nie je automaticky prioritný. Sebavedomý tón nie je kalibrovaná pravdepodobnosť pravdy.
Produkt ChatGPT nie je jednoznačné synonymum architektúry GPT. Claude, Gemini, Grok a ďalšie názvy takisto označujú rodiny modelov a služby, ktoré sa aktualizujú. Porovnaniu aktuálnych ekosystémov, bez marketingovej tabuľky, sa bude venovať kapitola 10.
Väčší model môže byť lepší v priemere, ale menší model môže byť vhodnejší pre latenciu, súkromie alebo úzku úlohu. Benchmarkový rekord nemusí prežiť slovenčinu a firemné výnimky. Kvalita je vektor vlastností, nie jedno číslo.
Napokon: schopnosť formulovať medicínsku radu nie je licencia, schopnosť simulovať empatiu nie je vzťah a správna odpoveď nie je dôkaz vedomia. LLM je mimoriadne flexibilný výpočtový model, no spoločenské oprávnenie patrí ľuďom a inštitúciám.
Minimálny slovník pre ďalšie kapitoly
- Token, parameter, kontext, embedding, attention, logit, checkpoint a inferencia označujú odlišné časti mechanizmu.
- Pretraining, post-training, fine-tuning, prompting a retrieval sú odlišné spôsoby, ako ovplyvniť správanie.
- Model, systém, poskytovateľ a nasadzujúca organizácia sú odlišné úrovne zodpovednosti.
Token je diskrétna jednotka vstupu alebo výstupu. Embedding je jej vektorová reprezentácia. Parameter je naučená hodnota vo váhach. Aktivácia je dočasná hodnota pri konkrétnom výpočte. Logit je nenormalizované skóre výstupného tokenu. Checkpoint je uložený stav modelu v určitom bode tréningu.
Kontext je aktuálna vstupná sekvencia, ktorú model smie použiť. Attention je mechanizmus kombinovania informácie medzi pozíciami. Inferencia je používanie natrénovaného modelu na výpočet výstupu. Decoding je stratégia výberu tokenov z výstupných distribúcií.
Pretraining buduje všeobecný základ na širokých dátach. Post-training prispôsobuje správanie po ňom. Fine-tuning aktualizuje aspoň časť parametrov na ďalších dátach. Prompting mení aktuálny kontext bez zmeny váh. RAG pred generovaním vyhľadá externý obsah.
Model je matematický artefakt. AI systém zahŕňa komponenty a pracovný tok. Poskytovateľ modelu vytvára alebo uvádza základ, downstream provider ho integruje a deployer používa systém v konkrétnom kontexte. Terminológia sa môže právne líšiť, preto sa vždy uvedie rámec.
Ako sú prepojené ďalšie kapitoly
- Kapitoly 2 až 7 rozoberú vstup, učenie, faktické chyby, kontext, adaptáciu a externé znalosti.
- Kapitoly 8 až 10 rozšíria pohľad o modality, otvorenosť a porovnanie hlavných produktových rodín.
- Kapitoly 11 až 15 vysvetlia decoding, limity, bezpečnosť, budúci vývoj a kalibrovanú dôveru.
Tokeny a ich význam ukážu, prečo model nečíta rovnaké jednotky ako človek. Tréning modelov prejde dátový pipeline, optimalizáciu, scaling a post-training. Halucinácie AI vysvetlia mechanizmy a metriky negrounded výstupu. Kontextové okno oddelí nominálnu dĺžku od efektívneho využitia.
Fine-tuning porovná plnú aktualizáciu, parameter-efficient metódy, instruction tuning a preferenčné postupy. RAG pridá index, embeddings, retrieval, reranking a citácie. Multimodálne modely vysvetlia, ako sa text prepája s obrazom, zvukom a videom.
Open-source vs. komerčné modely rozložia otvorenosť váh, kódu, dát a licencie. GPT, Claude, Gemini, Grok porovná rodiny podľa transparentnej metodiky a dátumu. Ako modely generujú odpovede rozoberie sampling, cache, test-time compute a štruktúrovaný výstup.
Limity a bezpečnosť oddelia epistemické, technické, spoločenské a útočné problémy. Budúcnosť LLM bude pracovať so scenármi namiesto istých dátumov. Kedy AI dôverovať uzavrie tému praktickou kalibráciou podľa zdroja, stakes a kontroly.
Čo z toho vyplýva
- LLM je veľký pravdepodobnostný neurónový model sekvencií, spravidla transformerový a predtrénovaný na širokých tokenizovaných dátach.
- Jeho flexibilita vzniká z prenositeľných reprezentácií a podmieňovania kontextom; jeho chyby vyplývajú aj z rozdielu medzi predikciou tokenu a cieľmi pravdy či bezpečnej akcie.
- Odborne sa vždy rozlišuje základný model, post-training, aplikácia, externé nástroje, používateľ a inštitucionálny kontext.
Najdôležitejší mentálny obraz nie je knižnica hotových odpovedí ani digitálny človek. Je to natrénovaná transformačná sieť, ktorá pre daný tokenový kontext vytvára distribúciu ďalších možností. V jej parametroch sú komprimované široké jazykové pravidelnosti a asociácie, nie garantovaný aktuálny register pravdy.
Tento mechanizmus stačí na pozoruhodne široké schopnosti, pretože veľa úloh možno vyjadriť jazykom a ich vzory existujú v dátach. Nestačí však na automatickú dôveru. Spoľahlivosť vzniká až spojením vhodného modelu, overiteľného kontextu, nástroja, evaluácie, bezpečnostných hraníc a zodpovedného človeka.
Definícia LLM je preto aj návodom na ďalšie otázky. Z čoho vznikli tokeny? Čo sa zmenilo počas tréningu? Odkiaľ pochádza fakt? Koľko kontextu model skutočne využil? Ktorý komponent vykonal akciu? Nasledujúce kapitoly budú tieto vrstvy postupne oddeľovať, aby plynulé rozhranie nezakrývalo presný technický a spoločenský systém.
Zdroje a ďalšie čítanie
- Jurafsky a Martin: Speech and Language Processing, 3. vydanie, kapitola 7 - Large Language Models (2026)
- Jurafsky a Martin: Speech and Language Processing, 3. vydanie - úplný rukopis (2026)
- Vaswani et al.: Attention Is All You Need
- Devlin et al.: BERT - Pre-training of Deep Bidirectional Transformers for Language Understanding
- Radford et al.: Improving Language Understanding by Generative Pre-Training
- Brown et al.: Language Models are Few-Shot Learners
- Raffel et al.: Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
- Kaplan et al.: Scaling Laws for Neural Language Models
- Hoffmann et al.: Training Compute-Optimal Large Language Models
- Ouyang et al.: Training Language Models to Follow Instructions with Human Feedback
- Rafailov et al.: Direct Preference Optimization - Your Language Model Is Secretly a Reward Model
- Fedus, Zoph a Shazeer: Switch Transformers - Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
- Bommasani et al.: On the Opportunities and Risks of Foundation Models
- Stanford CRFM: Reflections on Foundation Models
- Liang et al.: Holistic Evaluation of Language Models
- Bender a Koller: Climbing towards NLU - On Meaning, Form, and Understanding in the Age of Data
- Bender et al.: On the Dangers of Stochastic Parrots
- Mitchell et al.: Model Cards for Model Reporting
- Gebru et al.: Datasheets for Datasets
- NIST: Artificial Intelligence Risk Management Framework
- NIST: Generative Artificial Intelligence Profile
- Akt EÚ o AI - nariadenie (EÚ) 2024/1689
- Stanford HAI: What Is a Large Language Model?
- Naveed et al.: A Comprehensive Overview of Large Language Models
- Minaee et al.: Large Language Models - A Survey
- Kaddour et al.: Challenges and Applications of Large Language Models
- Shazeer et al.: Outrageously Large Neural Networks - The Sparsely-Gated Mixture-of-Experts Layer
- Dao et al.: FlashAttention - Fast and Memory-Efficient Exact Attention with IO-Awareness
- OpenAI: GPT-4 Technical Report
- International AI Safety Report 2026
Praktické odpovede
Často kladené otázky
Čo znamená skratka LLM?
Large Language Model, teda veľký jazykový model. Ide o model trénovaný na rozsiahlych textových dátach na predikciu a generovanie tokenov.
Je ChatGPT samotný jazykový model?
ChatGPT je aplikácia postavená okolo modelov a ďalších vrstiev, napríklad rozhrania, systémových pravidiel, bezpečnostných mechanizmov a nástrojov.
Prečo LLM dokáže riešiť veľa rôznych úloh?
Široké predtrénovanie mu umožňuje zachytiť množstvo jazykových a konceptuálnych vzorov, ktoré sa dajú aktivovať inštrukciou a príkladmi v kontexte.
Najlepšie porozumenie vzniká, keď si zhrniete tri hlavné myšlienky vlastnými slovami.
Prihlásiť / registrovať