Model tvorí pravdepodobné pokračovanie, nie garantovanú pravdu.
Jazykový model vytvára pokračovanie textu podľa naučených vzťahov a dodaného kontextu. Plynulosť odpovede nie je dôkazom pravdivosti ani overenia zdrojov.
Po prečítaní budete vedieť
- vysvetliť hlavný princíp na vlastnom príklade
- rozlíšiť údaj, odhad a vykonanú akciu
- určiť, čo treba pred použitím výsledku skontrolovať
Požiadate nástroj o stručné vysvetlenie fotosyntézy. Odpovie plynulým odsekom. Potom ho požiadate o vysvetlenie pre dieťa a text zjednoduší. Táto pružnosť vyplýva zo schopnosti vytvárať obsah podľa kontextu, nie iba vyberať jednu pripravenú odpoveď.
Veľký jazykový model, LLM, je model trénovaný na rozsiahlych jazykových dátach, ktorý sa dá použiť pri viacerých úlohách. Generatívna AI je širšie označenie pre systémy vytvárajúce obsah. Nie každý generatívny model pracuje s jazykom a nie každý jazykový model slúži predovšetkým na generovanie.
Model a chatbot nie sú rovnaká vec
Model vykonáva výpočty. Chatbot je aplikácia, ktorá sprostredkuje rozhovor a môže pridávať ďalšie funkcie. Môže vyhľadávať, čítať dokumenty, ukladať nastavenia alebo používať nástroje.
Ak aplikácia správne odpovie na dnešnú otázku o otváracích hodinách, nemusí ísť o poznatok z parametrov modelu. Mohla si údaje dohľadať. Ak odpovie na priložený dokument, môže ho spracovať ako kontext aktuálnej úlohy.
Rovnaký základný model tak môže poskytovať odlišnú skúsenosť v rôznych produktoch. Záleží na dostupných nástrojoch, systémových pokynoch a podkladoch. Hodnotenie chatbotu preto nemožno redukovať na názov modelu.
Pre začiatočníka je užitočné pýtať sa na konkrétnu funkciu: z akých informácií odpoveď vznikla a čo aplikácia skutočne urobila? Veta „mám prístup k súboru“ v texte odpovede nie je sama osebe dôkazom úspešného načítania.
Text sa mení na tokeny
Model nepracuje priamo s tlačenými písmenami. Text sa pomocou tokenizéra prevádza na jednotky nazývané tokeny. Token môže zodpovedať slovu, časti slova, znaku alebo inej časti zápisu. Pravidlá závisia od konkrétneho tokenizéra.
Jedno slovenské slovo preto nemusí byť jeden token. Počet slov a počet tokenov sú odlišné miery. Význam to má pri technických limitoch a nákladoch, ale aj pri porovnávaní jazykov. Rovnaká myšlienka môže mať pri rôznych zápisoch odlišnú dĺžku reprezentácie.
V modelovej vete „Zajtra otvoríme knižnicu“ sa môžu časti slov rozdeliť rôzne. Nie je potrebné hádať presné rozdelenie bez znalosti tokenizéra. Dôležité je pochopiť, že model získava číselne reprezentovanú sekvenciu, nie hotové ľudské pojmy.
Počas generovania sa vytvorené tokeny menia späť na text. To vysvetľuje, prečo technický limit nemusí zodpovedať jednoduchému počtu strán alebo viet.
Reprezentácie umožňujú počítať vzťahy
Tokeny sa prevádzajú na číselné reprezentácie. Embedding je vektor, teda zoznam čísel, ktorý sa dá využívať na zachytenie vzťahov. Pri spracovaní kontextu sa reprezentácie menia podľa okolitých častí. Google: Embeddings.
Význam slova „zámok“ závisí od vety. Veta o dverách a veta o historickej stavbe vytvárajú odlišný kontext. Model môže využívať tieto rozdiely pri tvorbe odpovede alebo reprezentácie pre vyhľadávanie.
Nemali by sme si však predstavovať slovník, v ktorom má každý pojem jedinú úplnú definíciu uloženú na jednom mieste. Výpočtové reprezentácie sú rozložené a menia sa počas spracovania. Ich interpretácia je predmetom výskumu.
Podobnosť reprezentácií môže pomôcť nájsť relevantný text. Nezaručuje, že dva texty obsahujú zhodné tvrdenie. Vety „zmluva je platná“ a „zmluva nie je platná“ sú tematicky blízke, ale ich význam sa zásadne líši.
Predikcia pokračovania je tréningová úloha
Mnohé generatívne jazykové modely sa pri predtréningu učia odhadovať nasledujúci token podľa predchádzajúceho kontextu. Takýto cieľ umožňuje využiť veľké množstvo textu bez ručného zadávania odpovede ku každej vete.
Práca o GPT-3 opisovala autoregresívny model a riešenie rozličných úloh pomocou textových pokynov a príkladov. Brown a kolektív, 2020.
Formulácia „model predikuje tokeny“ je dôležitá, ale sama osebe nevysvetľuje celý rozsah schopností. Predikcia prebieha nad kontextom spracovaným rozsiahlym modelom. Jednoduchý tréningový cieľ môže podporiť reprezentácie využiteľné pri zložitejších úlohách.
Rovnako však nepreukazuje overovanie pravdy. Model môže vytvoriť vetu, ktorá je jazykovo a kontextovo pravdepodobná, ale fakticky nesprávna. Pravdepodobnosť pokračovania textu a pravdivosť tvrdenia sú odlišné veci.
Pokyny a príklady menia aktuálnu úlohu
Keď do zadania pridáte ukážku žiadaného formátu, model môže prispôsobiť odpoveď bez toho, aby sa kvôli tejto interakcii zmenili jeho základné parametre. Hovoríme o využití kontextu, nie automaticky o novom tréningu.
Predstavte si zadanie na triedenie otázok. Uvediete dva príklady označenia a tretiu správu na zaradenie. Model môže odvodiť, aký formát a kategórie očakávate. Jeho výkon však treba preveriť na ďalších prípadoch.
Príklady môžu obsahovať aj chybu. Ak ukážky miešajú názvy kategórií, systém môže prevziať nejasnosť. Preto je kvalitné zadanie skôr presným vymedzením úlohy než súborom magických slov.
Vhodný pokyn obsahuje materiál, cieľ a požadovaný spôsob výstupu. Ak chýbajú podklady, žiadne zdôraznenie odbornosti nenahradí informáciu, ktorú model nemá.
Dolaďovanie zlepšuje správanie podľa určitého cieľa
Predtrénovaný model sa môže ďalej učiť na ukážkach pokynov a odpovedí. Ďalšie postupy využívajú preferencie hodnotiteľov, odmeny alebo overiteľné výsledky. Ide o tréningové procesy, ktoré treba odlišovať od bežného promptu.
Práca o InstructGPT ukázala zlepšenie zodpovedania pokynov pomocou ľudských demonštrácií a spätnej väzby. Autori zároveň uviedli pretrvávajúce chyby. Dolaďovanie na užitočnosť teda nepredstavovalo úplné odstránenie nespoľahlivosti. Ouyang a kolektív, 2022.
Preferencia človeka tiež nemusí byť totožná s faktickou správnosťou. Hodnotiteľ môže uprednostniť jasnú, dobre napísanú odpoveď, aj keď prehliadne odborný nedostatok. Návrh hodnotenia má preto zásadný význam.
Výskum DPO je príkladom alternatívneho učenia z preferencií. Nie všetky systémy, ktoré sa správajú podobne v rozhovore, preto museli vzniknúť rovnakým tréningovým postupom. Rafailov a kolektív, 2023.
Kontext má obmedzený rozsah aj praktickú účinnosť
Kontextové okno určuje technický rozsah informácií, ktoré môže model pri danom spracovaní zohľadniť. Aplikácia môže konverzáciu skracovať alebo vyberať časti. Dlhý rozhovor preto nemusí znamenať plnú dostupnosť všetkých predchádzajúcich viet.
Ani vstup, ktorý sa zmestí do okna, nemusí byť využitý dokonale. Výskum Lost in the Middle ukázal pri skúmaných modeloch citlivosť na polohu relevantnej informácie v dlhom kontexte. Výsledok treba čítať s ohľadom na testované modely a úlohy. Liu a kolektív, 2023.
V modelovom dokumente môže byť všeobecné pravidlo na začiatku a výnimka v prílohe. Zhrnutie, ktoré zachytí pravidlo a vynechá výnimku, je pri praktickom použití neúplné. Počet nahraných strán nepreukazuje ich rovnomerné a správne spracovanie.
Pri dlhých podkladoch pomáha zadanie viazané na konkrétne otázky a požiadavka uviesť oporu vo vhodnom mieste dokumentu. Ani taká požiadavka neodstraňuje potrebu skontrolovať, či citované miesto naozaj podporuje tvrdenie.
Vyhľadávanie dopĺňa dostupné informácie
RAG, retrieval-augmented generation, prepája vyhľadanie relevantných podkladov s generovaním odpovede. Systém najprv získa texty alebo ich časti a následne ich poskytne modelu ako oporu.
Pôvodná práca Lewisa a kolektívu z roku 2020 skúmala spojenie parametrickej a neparametrickej pamäte pri jazykových úlohách. Ide o významný výskumný základ, nie univerzálnu záruku pravdivosti každej aplikácie označenej RAG. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.
V modelovej škole môže systém vyhľadať článok školského poriadku a podľa neho odpovedať. Chyba môže vzniknúť pri výbere neplatnej verzie, pri vynechaní výnimky alebo pri nesprávnom preformulovaní.
Oddelene preto hodnotíme kvalitu vyhľadania a kvalitu odpovede. Ak sa relevantná pasáž nenašla, model nemusí mať potrebný podklad. Ak sa našla, ale odpoveď ju zmenila, problém vznikol v ďalšom kroku.
Nástroje poskytujú overiteľné operácie
Jazykový model môže navrhnúť použitie kalkulačky, vyhľadávača alebo programu. Aplikácia vykoná volanie nástroja a výsledok sa vráti ako ďalší vstup. Takto môže systém spracovať úlohu, ktorú by samotné generovanie textu nezvládalo spoľahlivo.
Výskum Toolformer skúmal učenie jazykového modelu využívať nástroje. Je to príklad toho, ako sa tvorba jazykového výstupu môže kombinovať s externými operáciami. Schick a kolektív, 2023.
V modelovej úlohe počítania nákladov môže program vykonať presný súčet. Stále však treba skontrolovať, či použil správne položky. Presný výpočet nad neúplným zoznamom poskytne neúplný výsledok.
Výstup „súbor som vytvoril“ má význam iba vtedy, ak sa príslušná operácia uskutočnila a súbor existuje. Rozhovor umožňuje činnosť opísať; existencia nástroja umožňuje činnosť vykonať. Tieto dve schopnosti treba dôsledne odlišovať.
Variabilita odpovedí má technické príčiny
Generovanie môže využívať rôzne stratégie výberu tokenov. Pri niektorých nastaveniach vznikajú variabilnejšie odpovede. Zmena zadania alebo kontextu tiež ovplyvní výsledok. Nie každá rozdielna formulácia znamená odlišný faktický záver.
Pri tvorivej úlohe môže byť variabilita užitočná. Pri extrakcii čísla z dokumentu by sme však chceli stabilnú zhodu s podkladom. Nastavenie vhodné na brainstorming nemusí byť vhodné na presný prepis.
Nižšia variabilita sama osebe neodstráni halucinácie. Model môže rovnakú chybu opakovať konzistentne. Preto treba odlišovať opakovateľnosť a správnosť. Stabilný výstup je výhoda pre kontrolu, ale nie dôkaz pravdy.
Prečo model môže vymyslieť zdroj
Vedecké citácie majú typické jazykové vzorce: mená, rok, názov a časopis. Model môže vytvoriť presvedčivú kombináciu týchto častí aj bez existujúcej publikácie. Výsledok môže formálne pripomínať bibliografický záznam.
Pri použití na odbornom webe preto vyžadujte dohľadateľný dokument. Názov, autori a odkaz musia patriť k tej istej publikácii. Ani funkčný odkaz nestačí, ak smeruje na nesúvisiaci článok.
NIST označuje vytváranie nepravdivého obsahu za jedno z rizík generatívnej AI a pracuje aj s pojmom konfabulácia. Takéto riziko treba hodnotiť podľa kontextu použitia. NIST: Generative Artificial Intelligence Profile.
Pri návrhu fantastickej poviedky je vymyslené meno prípustné. Pri citácii odbornej práce je to závažný nedostatok. Rovnaký mechanizmus tvorby obsahu preto potrebuje odlišný spôsob kontroly podľa cieľa.
Čítajte mapu od východiska cez súvislosť až po dôsledok. Spoločným jadrom je „Jeden prompt, viac možností“.
Zadanie na použiteľnú sumarizáciu
Modelová úloha: máte verejný oznam o zatvorení knižnice. Chcete krátku správu na web. Zmysluplný pokyn môže znieť: „Zhrň tento oznam do troch viet. Zachovaj dátumy a podmienky. Nepridávaj dôvody, ktoré text neuvádza. Ak údaj chýba, nevymýšľaj ho.“
Výsledok potom porovnajte s pôvodným oznamom. Kontrolujte termín, rozsah obmedzenia a výnimku. Pokyn o nevymýšľaní podporuje žiadané správanie, ale nezaručuje, že model nikdy nič nepridá.
Ak oznam hovorí o uzavretí čitárne, nesmie vzniknúť správa o uzavretí celej knižnice. Ak výnimka platí pre vrátenie kníh, nemôže sa stratiť vo všeobecnej vete. Pedagogicky správne hodnotenie sa viaže na význam, nie iba na plynulosť.
Pravdepodobné pokračovanie a pravdivá informácia
Použime vymyslenú vetu „Otváracie hodiny knižnice sú...“. Jazykový model môže vytvoriť rozdelenie možných pokračovaní. Určité časy sa v podobných textoch vyskytujú častejšie než iné. To však neurčuje hodiny konkrétnej knižnice v konkrétny deň.
Ak v kontexte nie sú overené údaje, pravdepodobné pokračovanie môže znieť úplne prirodzene a zároveň byť nesprávne. Hodina deväť je jazykovo prijateľná, ale príslušná pobočka môže otvárať až o desiatej. Výber tokenu nepridáva chýbajúci aktuálny dôkaz.
Pri tréningu sa model naučí mnoho pravidelností vrátane faktických súvislostí dostupných v dátach. Môže preto zodpovedať aj otázku, ktorej presné znenie nevidel. Neznamená to však, že pri každej odpovedi vyhľadá pôvodný doklad alebo skontroluje jeho platnosť.
Model môže pokračovať aj nesprávnym predpokladom vloženým do otázky. Zadanie „prečo knižnica zrušila všetky pobočky“ môže vyvolať vysvetlenie údajného zrušenia. Ak sa udalosť nestala, celý výklad stojí na chybnom východisku.
Preto je pri faktickej úlohe užitočné najprv preveriť predpoklad. Otázka má rozlišovať medzi tým, čo vieme, čo hľadáme a čo iba predpokladáme. Dobrá formulácia uľahčuje kontrolu; samotný model však zostáva schopný vytvoriť nepodložené pokračovanie.
Generovanie a klasifikácia môžu používať podobný základ
Starší klasifikátor často vracal jednu kategóriu podľa pevne určenej úlohy. Generatívny jazykový model môže dostať pokyn na triedenie, prepis, vysvetlenie aj návrh. Rozdiel spočíva v pružnosti zadania a vytváraného výstupu, nie v tom, že klasifikácia patrí do úplne nesúvisiaceho sveta.
Model môže napríklad zaradovať otázky do kategórií doprava, kultúra a školstvo. Ak má odpovedať iba jedným názvom, potrebujeme otestovať, či dodržiava povolené možnosti. Plynulý komentár navyše môže byť pri automatickom spracovaní nežiaduci.
Generatívne riešenie tiež nemusí byť najúspornejšie. Pre stabilnú úlohu s veľkým počtom krátkych vstupov môže vyhovovať menší špecializovaný klasifikátor. Naopak, pri meniacej sa práci s dokumentmi môže byť pružné rozhranie veľmi užitočné.
Rozhodnutie preto zahŕňa výkon, náklady, požadovaný formát a dostupnú kontrolu. Nie je správne hodnotiť všetky staršie riešenia ako zastarané len preto, že nevedú rozhovor. Niektoré sú vhodné práve vďaka jasným obmedzeniam.
Jedna ukážka nie je nový tréning
Do zadania vložíme príklad správnej odpovede a model ho nasleduje. Pri nasledujúcom samostatnom rozhovore však nemusí mať túto ukážku dostupnú. Použitie príkladu v kontexte a zmena parametrov počas tréningu sú odlišné procesy.
V modelovej úlohe chceme prepisovať oznamy do formátu dátum, miesto, udalosť. Ukážeme dve vzorové položky. Model môže odvodiť požadovanú štruktúru a spracovať ďalší oznam. Nevytvorili sme tým automaticky nový trvalo upravený model.
Ak aplikácia ukladá naše nastavenie alebo ukážku a znovu ich pridáva, výsledok môže pôsobiť ako zapamätanie. Technickým mechanizmom môže byť dostupný uložený kontext. To tiež neznamená, že sa zmenili váhy základného modelu.
Pri výučbe používajme presné slovesá. Model dostal príklad, aplikácia uložila nastavenie alebo prebehol tréning. Všetky tri opisy môžu byť správne v rôznych situáciách, ale nie sú zameniteľné.
Pamäť konverzácie má viac možných vrstiev
Používateľ môže vidieť celý rozhovor na obrazovke. Aplikácia však môže pri jednom volaní spracovať iba vybraný rozsah, zhrnutie alebo relevantné pasáže. Zobrazená história a aktuálny vstup modelu nemusia byť totožné.
Predstavme si dlhú prácu na článku. Na začiatku sme určili publikum, neskôr upravili terminológiu a nakoniec zmenili rozsah. Ak sa pri skracovaní stratí posledné rozhodnutie, model môže vytvoriť výsledok podľa starších podmienok.
Praktickou pomôckou je priebežne udržiavať stručné zadanie s aktuálnymi požiadavkami. Nie je potrebné opakovať celý rozhovor. Potrebujeme zachovať informácie, ktoré skutočne rozhodujú o výsledku: cieľ, podklady, formát a posledné zmeny.
Ani uložená informácia nemusí byť vhodná pre každú budúcu úlohu. Predchádzajúca preferencia krátkych odpovedí nemá automaticky prevážiť nové zadanie na rozsiahly odborný článok. Kontext sa má interpretovať vzhľadom na aktuálnu požiadavku.
Ako vzniká odpoveď nad školským dokumentom
Modelový systém odpovedá na otázku, či sa dá kniha vrátiť počas zatvorenia pobočky. Má k dispozícii súbor pravidiel a aktuálny oznam. Najprv musí vyhľadať relevantné časti. Potom z nich vytvorí odpoveď zodpovedajúcu konkrétnej otázke.
Ak nájde iba všeobecné otváracie hodiny, chýba mu výnimka pre návratový box. Ak nájde starý oznam, môže poskytnúť neplatný termín. Ak nájde správne časti, stále môže zameniť možnosť vrátenia s možnosťou osobnej návštevy.
Hodnotenie rozdelíme na tri otázky. Našli sa potrebné informácie? Sú to vhodné a platné podklady? Zachováva odpoveď ich význam? Tak dokážeme lokalizovať chybu namiesto všeobecného konštatovania, že chatbot sa pomýlil.
Pri prevádzke je dôležitý aj postup pre chýbajúci údaj. Systém môže uviesť, že v dostupných podkladoch nenachádza odpoveď, a odkázať na overenie. Musíme však testovať, či tak reaguje aj v konkrétnych nejasných prípadoch.
Delenie dokumentu môže oddeliť pravidlo od výnimky
Vyhľadávací systém často nevracia celý archív naraz. Pracuje s menšími časťami. Spôsob rozdelenia dokumentu teda ovplyvňuje, aké informácie sa dostanú do kontextu.
Predstavme si pravidlo uvedené v odseku a výnimku v ďalšom. Ak vyhľadanie vráti iba prvý odsek, odpoveď môže byť zrozumiteľná, ale neúplná. Ak tabuľka pokračuje na ďalšej strane, samotný riadok bez hlavičky môže stratiť význam.
Pri príprave podkladov preto zachovávame súvislosti: nadpis, jednotky, obdobie platnosti a väzby na prílohy. Nie vždy sa všetko zmestí do jednej časti. Systém však potrebuje postup, ktorý umožní dohľadať súvisiacu informáciu.
V modelovom testovaní použijeme otázku, na ktorú treba dve pasáže. Tak overíme viac než jednoduché nájdenie jedného hesla. Úspech pri otázke na názov dokumentu ešte nepreukazuje úspech pri interpretácii výnimky.
Odkaz musí podporovať konkrétnu vetu
Odpoveď môže obsahovať skutočný odkaz a stále byť nesprávna. Zdroj sa môže týkať inej pobočky, iného obdobia alebo všeobecnej zásady. Preto kontrolujeme vzťah medzi tvrdením a konkrétnym obsahom.
Ak veta hovorí o termíne zatvorenia, otvoríme miesto s termínom. Ak tvrdí, že služba zostáva dostupná, hľadáme výslovné uvedenie tejto možnosti. Nemalo by stačiť, že zdroj obsahuje rovnaké kľúčové slovo.
Aj prepis môže zmeniť mieru istoty. „Služba môže byť dočasne obmedzená“ nie je totožné s „služba je zrušená“. Rozdiel medzi možnosťou, plánom a uskutočnenou zmenou patrí medzi významové detaily, ktoré treba zachovať.
Taká kontrola je obzvlášť dôležitá pri odbornom texte. Viditeľná citácia vytvára dojem opory. Dôveryhodnosť vzniká až vtedy, keď dostupný zdroj skutočne podopiera obsah a čitateľ vie rozlíšiť zistenie od interpretácie.
Kreatívna úloha a presná extrakcia potrebujú iné hodnotenie
Pri návrhu názvov výstavy požadujeme rôznorodosť a zrozumiteľnosť. Viac odpovedí môže byť rovnako vhodných. Pri prepise dátumu z pozvánky je správna hodnota určená podkladom. Vymyslená alternatíva nemá tvorivú hodnotu.
Modelová redakcia preto rozdelí zadanie. Najprv extrahuje overené údaje: dátum, miesto a názov. Potom z nich pripraví niekoľko titulkov. Výsledný titulok môže meniť formuláciu, ale nesmie meniť údaje.
Pri hodnotení extrakcie sledujeme zhodu s dokumentom a úplnosť. Pri titulkoch posudzujeme aj tón, čitateľnosť a primeranosť. Jedno všeobecné skóre „páči sa mi odpoveď“ by tieto rozdiely zakrylo.
Rovnako rôzne nastavenia generovania neriešia celý problém. Potrebujeme jasný cieľ a vhodné overenie. Stabilnejší výstup môže uľahčiť kontrolu, ale aj stabilne opakovať nesprávny údaj.
Viackroková odpoveď môže obsahovať skrytý prvý omyl
Zadanie môže požadovať zhrnutie dokumentu, výber hlavných tém a návrh otázok. Ak úvodné zhrnutie zmení význam, ďalšie kroky môžu dôsledne rozvíjať nesprávny základ. Výsledná odpoveď pritom pôsobí súdržne.
V modelovom materiáli je dobrovoľná aktivita nesprávne označená ako povinná. Otázky potom preverujú, kedy musia všetci účastníci nastúpiť. Jazykové spracovanie môže byť kvalitné, ale pedagogický obsah je chybný už od prvého kroku.
Priebežná kontrola dôležitých medzivýsledkov pomáha chybu odhaliť skôr. Nemusíme kontrolovať každú vetu každého návrhu. Potrebujeme skontrolovať tie zistenia, na ktorých stoja ďalšie rozhodnutia a finálny obsah.
Viditeľný podrobný výklad tiež nemusí spoľahlivo dokumentovať všetky vnútorné výpočty. Posudzujeme overiteľné kroky a výsledky: použité podklady, extrahované údaje a skutočne vykonané operácie. Presvedčivé vysvetlenie nie je samostatným dôkazom správnosti.
Veľkosť modelu nie je jedinou podmienkou výkonu
Výkon závisí od architektúry, množstva a kvality dát, tréningu aj konkrétnej úlohy. Výskum Training Compute-Optimal Large Language Models skúmal vzťah medzi veľkosťou modelu, množstvom tréningových tokenov a výpočtovým rozpočtom.
Z tohto výskumu nemožno odvodiť jednoduché pravidlo, že každý väčší model bude lepší pri každej slovenskej otázke. Porovnanie potrebuje relevantné úlohy a podmienky. Aj menší model môže byť vhodný pre úzko vymedzenú činnosť.
Pri modelovom triedení krátkych oznamov nás zaujíma spoľahlivosť kategórie a dodržanie formátu. Pri analýze dlhého dokumentu zase zachovanie súvislostí a podpora tvrdení. Súhrnné číslo z odlišného testu nemusí odpovedať na naše potreby.
Aj názov „veľký“ je relatívny. Vzdelávací text nemusí určovať univerzálnu hranicu počtu parametrov. Podstatné je pochopiť druh modelu a jeho spôsob použitia, potom preveriť výkon na konkrétnom zadaní.
Model tvorí pravdepodobné pokračovanie, nie garantovanú pravdu. Náčrt použite ako krátku kontrolu pred praktickým rozhodnutím.
Presný pokyn odstraňuje zbytočné nejasnosti
Zadanie „urob dobrý text“ necháva otvorené publikum, dĺžku aj účel. Model môže doplniť vlastné predpoklady. Ak chceme text pre žiakov bez predchádzajúcich znalostí, máme túto informáciu uviesť spolu s požadovanými pojmami.
Dobré zadanie tiež určí, čo sa má zachovať z podkladu. Pri ozname sú to dátumy a podmienky. Pri učive môže ísť o rozdiel medzi algoritmom a modelom. Požiadavka jednoduchosti nesmie viesť k odstráneniu rozhodujúcej hranice.
Ak je otázka nejasná, model môže navrhnúť interpretácie alebo požiadať o chýbajúci údaj. Pri hodnotení neuprednostňujeme automaticky najrýchlejšiu odpoveď. Doplňujúca otázka môže byť kvalitnejším výsledkom než presný výklad nesprávne pochopeného zadania.
Formulácia promptu však nenahrádza chýbajúce oprávnenie, nedostupný nástroj ani zdroj. Pokyn „over všetko“ má zmysel iba spolu s reálnym postupom overovania. Potrebujeme vidieť, kde sa údaje skontrolovali a čo zostalo nejasné.
Jazyková správnosť a odborná správnosť
Slovensky plynulá odpoveď môže nesprávne vysvetliť odborný pojem. Napríklad slovo učenie použije na každé zapamätanie informácie v rozhovore. Jazyková úprava takú chybu nemusí odstrániť, pretože veta gramaticky funguje.
Pri vzdelávacom texte kontrolujeme pojmy samostatne. Sú definované rovnako v celom materiáli? Príklad naozaj zodpovedá definícii? Nezamenil sa tréning za používanie alebo výber zdroja za overenie pravdy?
Druhá kontrola sa týka dostupnosti. Odborne správna veta môže byť pre začiatočníka príliš hutná. Potom doplníme príklad alebo rozdelíme vysvetlenie. Úprava má uľahčiť porozumenie a zachovať presnosť.
Pri preklade odborných podkladov navyše sledujeme zaužívané názvy a kontext. Jedno anglické slovo môže mať viac významov. Mechanický preklad preto nie je dostatočným odborným overením ani v prípade veľmi prirodzeného výsledku.
Ako pripraviť vlastnú skúšku použiteľnosti
Vyberte menší súbor reprezentatívnych zadaní. Zaraďte jednoduchý prípad, dlhší podklad, neúplný údaj a otázku s nesprávnym predpokladom. Pri každom stanovte, čo by mala vhodná odpoveď obsahovať alebo priznať.
Zaznamenajte zadanie, podklad, dátum a použité nastavenia, ktoré poznáte. Potom porovnajte výstup s kritériami. Kontrolujte správnosť, úplnosť a dodržanie formátu samostatne. Príjemný tón nesmie zakryť vynechanú výnimku.
Ak výsledok zlyhá, skúste určiť príčinu. Chýbal zdroj, vyhľadanie našlo nesprávnu pasáž alebo model zmenil význam? Taký rozbor poskytuje lepší podklad pre úpravu než iba preformulovanie pokynu na „buď presnejší“.
Malý test nepreukazuje univerzálnu spoľahlivosť. Ukazuje však, či riešenie zvláda konkrétne zvolené situácie a ktoré prípady potrebujú ďalšiu kontrolu. Tento praktický prístup pomáha používať jazykové modely s jasným účelom.
Prečo rovnaký dokument môže viesť k inému zhrnutiu
Zhrnutie závisí od otázky aj publika. Pri tom istom ozname môže jeden používateľ potrebovať termín a druhý podmienky účasti. Nie je chyba, ak vhodné zhrnutia zdôraznia odlišné informácie. Chyba vzniká, keď zmenia význam alebo vynechajú údaj potrebný pre konkrétny účel.
V modelovom školskom ozname sa uvádza termín výletu, spôsob prihlásenia a osobitná podmienka dopravy. Trojvetové zhrnutie pre rodičov musí zachovať údaje potrebné na rozhodnutie. Zhrnutie do kalendára môže mať kratší formát, ale malo by umožniť dohľadať plné podmienky.
Pred hodnotením preto určíme funkciu textu. Požiadavka „stručne“ sama nehovorí, ktoré informácie možno vynechať. Pri presnom zadaní má čitateľ vedieť, čo má urobiť a kde nájde chýbajúce podrobnosti.
Ak model skráti text príliš, lepšou opravou je pomenovať povinné informácie než len žiadať dlhšiu odpoveď. Predĺženie môže priniesť viac všeobecných viet a stále nezachovať potrebnú podmienku.
Odborná revízia potrebuje pôvodné podklady
Redaktor dostane plynulý návrh článku. Pri jazykovej kontrole opraví slovosled a opakovania. Ak nemá pôvodné podklady, nemusí odhaliť zamenený rok, nesprávne priradený výsledok výskumu ani výnimku, ktorú návrh vynechal.
Preto spolu s návrhom uchovávame použité zdroje a rozlíšenie medzi prevzatými zisteniami a vlastnými príkladmi. Odborný kontrolór vie preveriť, či text vysvetľuje výskum primerane a nepripisuje mu širšie závery.
Modelové príklady označujeme tak, aby ich čitateľ nepovažoval za skutočné prípadové štúdie. Číselný výpočet môže správne ilustrovať mechanizmus, aj keď nepochádza z konkrétnej organizácie. Jeho pôvod musí zostať zrozumiteľný.
Odborná revízia je konkrétna činnosť vykonaná kompetentným človekom. Text ju nemá deklarovať len preto, že model dostal pokyn správať sa ako expert. Dôveryhodnosť webu závisí aj od pravdivého opisu redakčného procesu.
Ako čítať informácie o výkone modelu
Tvrdenie, že model dosiahol dobrý výsledok, potrebuje opis testu. Ak šlo o krátke anglické otázky, nemáme tým overenú analýzu slovenských dokumentov. Ak sa hodnotil správny výber z možností, nemáme automaticky overenú presnosť otvoreného odborného výkladu.
Pri porovnaní potrebujeme rovnaké alebo zrozumiteľne odlíšené podmienky. Dostupnosť vyhľadávača, kalkulačky či dodatočných pokusov môže výsledok meniť. Test samotného modelu a test kompletnej aplikácie tak môžu odpovedať na iné otázky.
Výskumný výsledok je preto dobré preložiť do konkrétneho významu: systém za uvedených podmienok zvládol určitý súbor úloh. Nevyvodzujeme z neho automaticky, že zvládne všetky podobne pomenované činnosti v bežnej prevádzke.
Pre používateľa je najhodnotnejšia informácia o úlohe, ktorú skutočne potrebuje. Všeobecný rebríček môže pomôcť zorientovať sa, ale nenahrádza kontrolu relevantných príkladov a požadovaného formátu výstupu.
Úloha: rozoberte odpoveď po jednotlivých tvrdeniach
Pripravte krátky podklad o vymyslenej výstave. Uveďte názov, termín, miesto a jedno obmedzenie. Požiadajte model o oznam. Potom označte každú faktickú informáciu vo výsledku a priraďte jej konkrétne miesto v podklade.
Ak odpoveď doplnila údaj, ktorý podklad neobsahuje, zistite, či ide o prípustnú štylistickú formuláciu alebo nové faktické tvrdenie. Veta pozývajúca návštevníkov nemusí meniť fakty. Informácia o bezplatnom vstupe ich mení, ak sa v podklade nenachádza.
Ďalej skontrolujte vynechania. Výsledok môže obsahovať iba správne vety a predsa neuvádzať podmienku, ktorá je pre návštevníka rozhodujúca. Správnosť jednotlivých tvrdení a úplnosť odpovede sú dve samostatné vlastnosti.
Nakoniec upravte zadanie tak, aby povinné údaje vymenovalo. Porovnajte nový výsledok podľa rovnakých kritérií. Nehodnoťte len to, ktorý text sa vám viac páči. Cieľom cvičenia je vidieť vzťah medzi podkladom, pokynom a výstupom.
Takto získate jednoduchý kontrolný postup pre ďalšie úlohy: oporu tvrdení, zachovanie podstatných podmienok a oddelenie faktov od formulácie. Dá sa použiť pri oznamoch, pracovných listoch aj stručných zhrnutiach. Pri náročnejšom odbornom obsahu však musí rozsah a kvalifikácia kontroly zodpovedať téme.
Čo si zaznamenať pri opakovanej práci
Pri opakovanom používaní uchovajte vzor zadania a kritériá výsledku. Nie preto, aby sa každá odpoveď formulovala rovnako, ale aby zostalo jasné, ktoré informácie musí zachovať. Pri zmene podkladu najprv skontrolujte, či pôvodné zadanie stále zodpovedá účelu.
V modelovej redakcii sa oznamy predtým týkali jednej pobočky a teraz viacerých. Starý pokyn môže viesť k zlúčeniu podmienok. Aktualizujeme ho tak, aby výsledok priraďoval termíny ku konkrétnym miestam. Potom preveríme reprezentatívne príklady.
Zaznamenajte aj podstatné opravy. Ak sa opakuje rovnaký problém, môže byť potrebná zmena pracovného postupu alebo prípravy dát. Samotné pridávanie dôrazných slov do promptu nemusí zasiahnuť príčinu.
Dobrý pracovný záznam je stručný a konkrétny. Obsahuje účel, zdroj, požadovaný výstup a známe slabé miesta. Pomáha ďalšiemu autorovi pokračovať bez hádania, ktoré podmienky boli pre výsledok rozhodujúce.
Úloha: odlíšte tri zdroje odpovede
Chatbot odpovie na otázku o historickej udalosti, o priloženom dokumente a o aktuálnom cestovnom poriadku. Aké podklady by ste očakávali pri každej úlohe?
Pri historickej udalosti môže využiť naučené reprezentácie, ale odborné tvrdenie má byť overiteľné v zdroji. Pri dokumente musí pracovať s jeho skutočným obsahom. Pri aktuálnom poriadku potrebuje aktuálny relevantný podklad. Jedno rozhovorové rozhranie nezaručuje splnenie všetkých troch podmienok.
Veľký jazykový model je užitočný, keď rozumieme jeho úlohe v celom systéme. Dokáže transformovať jazyk, spájať podklady a podporovať viacstupňovú prácu. O výslednej dôveryhodnosti však rozhoduje aj kvalita vstupov, vykonané nástroje a kontrola významu.
Pri kontrole vždy vychádzajte z konkrétneho použitého podkladu.
Pojmy v slovníku
token · kontextové okno (context window) · generatívna umelá inteligencia (generative AI)
Rozšírené vysvetlenie v Premium: Znalostná architektúra a RAG. Ako poskytnúť asistentovi dokumenty a spojiť odpoveď s dohľadateľnými podkladmi. Táto nadväzujúca kapitola je za paywallom (Registrácia + Premium). Celý tento úvodný kurz zostáva zadarmo.
Zhrnutie kapitoly
Jazykový model vytvára pokračovanie textu podľa naučených vzťahov a dodaného kontextu. Plynulosť odpovede nie je dôkazom pravdivosti ani overenia zdrojov.
Praktické odpovede
Často kladené otázky
Čo je hlavná myšlienka kapitoly „Generatívna AI a veľké jazykové modely“?
Jazykový model vytvára pokračovanie textu podľa naučených vzťahov a dodaného kontextu. Plynulosť odpovede nie je dôkazom pravdivosti ani overenia zdrojov.
Potrebujem na pochopenie programovanie?
Nie. Kapitola vysvetľuje princípy na modelových situáciách. Sledujte vstup, úlohu, výsledok a spôsob kontroly; matematické detaily nie sú podmienkou.
Ako si overím, že téme rozumiem?
Vyberte si iný príklad než v texte a vlastnými slovami vysvetlite postup. Pomenujte informácie, ktoré systém dostáva, jeho obmedzenia a človeka, ktorý skontroluje výsledok.
Najlepšie porozumenie vzniká, keď si zhrniete tri hlavné myšlienky vlastnými slovami.
Prihlásiť / registrovať