Prelom zvyčajne vzniká spojením viacerých technických posunov.
Prelom v AI málokedy tvorí jediný nápad. Praktická zmena vzniká, keď sa výskumný princíp stretne s výpočtovým výkonom, dátami, nástrojmi a dostupným produktom.
Po prečítaní budete vedieť
- priradiť dôležité objavy k problémom, ktoré vyriešili
- vysvetliť prepojenie algoritmov, hardvéru a dát
- odlíšiť vedecký prelom od produktového rozšírenia
- Dejiny AI nie sú priamou cestou od „hlúpych“ strojov k inteligencii, ale sledom meniacich sa paradigiem, období rastu a sklamania.
- Prelom zvyčajne nevytvorí jediný algoritmus: vzniká spojením myšlienky, dát, výpočtov, hardvéru, softvéru, hodnotenia a vhodného produktu.
- Dnešná generatívna AI stojí na desaťročiach práce v štatistike, neurovedách, optimalizácii, lingvistike, informačných systémoch a ľudskej spätnej väzbe.
O „objave, ktorý zmenil AI“ sa často rozpráva ako o jednom okamihu. V skutočnosti môže matematická myšlienka čakať desaťročia, kým sa objavia dáta a dostatočný hardvér. Neskôr ju musí niekto premeniť na stabilný softvér, zmerať na zdieľanom teste a integrovať do služby, ktorú ľudia vedia používať. Prelom je preto skôr konfigurácia podmienok než izolovaný záblesk.
Táto kapitola dopĺňa stručnú chronológiu z kapitoly 1 o odborné vysvetlenie mechanizmov. Nejde o zoznam všetkých dôležitých vedcov ani o rebríček zásluh. Vyberá míľniky, ktoré zmenili základnú predstavu o tom, ako vytvárať AI, alebo umožnili novú triedu praktických systémov. Mechanizmus učenia podrobnejšie vysvetľujú kapitoly 4 a 6; tu sledujeme, prečo sa jednotlivé prístupy stali historicky rozhodujúcimi.
Pri dátumoch treba rozlišovať publikovanie, prvú demonštráciu a masové rozšírenie. Transformer bol publikovaný v roku 2017, no chatboty založené na veľkých jazykových modeloch sa stali masovým rozhraním až neskôr. Neurónové siete existovali desaťročia pred „deep learning boomom“. Aj preto nie je korektné vysvetľovať dnešok iba posledným produktom.
Čo v tejto kapitole znamená prelom
- Koncepčný prelom mení spôsob formulácie problému; technický prelom umožní riešenie, ktoré predtým nebolo praktické.
- Infraštruktúrny a dátový prelom môže mať rovnaký význam ako nový algoritmus.
- Spoločenský prelom nastáva, keď technológia prekročí laboratórium a začne meniť inštitúcie, trhy alebo každodenné správanie.
Za koncepčný prelom možno považovať Turingovu otázku, či sa dá strojové myslenie skúmať cez pozorovateľné správanie. Algoritmickým prelomom je spätné šírenie chyby či attention. Infraštruktúrnym prelomom sú grafické procesory, distribuovaný tréning a dostupné frameworky. Dátovým prelomom je ImageNet alebo rozsiahle textové korpusy. Produktovým prelomom je rozhranie, ktoré sprístupní schopnosť bez programovania.
Míľnik hodnotíme podľa viacerých kritérií: otvoril nové úlohy, dramaticky zlepšil škálovanie, znížil potrebu ručne navrhnutých pravidiel, vytvoril prenositeľnú reprezentáciu alebo zásadne rozšíril používateľskú základňu? Dôležitá je aj trvácnosť. Niektoré mediálne demonštrácie boli slepou vetvou; iné nenápadné metódy sa stali základom celého odboru.
Objav môže byť významný, aj keď neskôr prehrá. Symbolické systémy ukázali silu explicitného poznania a zároveň odhalili krehkosť ručného zachytávania sveta. Expertné systémy neboli zbytočný omyl; vytvorili poznanie o reprezentácii, validácii a údržbe, ktoré je aktuálne aj pri dnešných modeloch.
Prelomy navyše nevznikajú vo vákuu. Financovanie, vojenské a priemyselné priority, univerzity, otvorené publikovanie, autorské právo, práca anotátorov a koncentrácia hardvéru ovplyvňujú, ktoré myšlienky sa rozvinú. Túto politicko-ekonomickú vrstvu rozoberie kapitola 13.
1936-1950: výpočet, stroj a testovateľná otázka
- Turingov model výpočtu poskytol formálny jazyk na rozlíšenie toho, čo možno algoritmicky vypočítať.
- V článku z roku 1950 Turing nahradil neurčitú otázku „môžu stroje myslieť?“ operačnou hrou založenou na konverzačnom správaní.
- Turingov test nie je definíciou inteligencie ani dôkazom vedomia; je historickou metodologickou provokáciou.
Alan Turing v roku 1936 opísal abstraktný stroj, ktorý manipuluje symbolmi podľa konečných pravidiel. Nešlo o návrh chatbota. Práca položila základ teórie výpočtu a ukázala aj limity: existujú otázky, ktoré všeobecný algoritmus nerozhodne. AI teda od začiatku stojí nielen na ambícii automatizovať, ale aj na formálnom poznaní hraníc výpočtu.
V článku Computing Machinery and Intelligence z roku 1950 Turing navrhol imitation game. Namiesto sporu o význam slova myslenie skúmal, či sa stroj v textovej komunikácii dokáže správať tak, že ho hodnotiteľ nerozlíši od človeka. Tento obrat bol prelomový: abstraktnú filozofickú otázku spojil s experimentálne posudzovaným správaním.
Dnešný veľký jazykový model môže v krátkom rozhovore pôsobiť ľudsky, no z toho nevyplýva všeobecná inteligencia, pravdivosť ani vedomie. Test je citlivý na hodnotiteľa, tému, dĺžku a podmienky. Jazyková imitácia môže maskovať chýbajúce ukotvenie vo svete. Mýty o „prebudení“ modelov rozoberajú kapitoly 2, 3 a 5.
Turingov trvalý prínos je metodologický: rozdeľ veľkú otázku na pozorovateľné schopnosti, navrhni podmienky skúšky a buď pripravený meniť kritérium. Súčasné benchmarky sú sofistikovanejšími príbuznými tejto tradície - a zdedili aj problém, že úspech v teste sa môže oddeliť od schopnosti v realite.
1943-1958: neurón ako výpočtová abstrakcia a perceptrón
- McCulloch a Pitts ukázali, že zjednodušené neurónové jednotky možno analyzovať ako logické výpočtové prvky.
- Rosenblattov perceptrón sa učil váhy z príkladov a presunul časť programovania zo explicitných pravidiel do dát.
- Jednovrstvový perceptrón mal zásadné obmedzenia; neskoršia kríza ukázala rozdiel medzi sľubnou myšlienkou a prehnaným očakávaním.
Model neurónu z roku 1943 spojil neurofyziologickú inšpiráciu s logikou. Neurón v umelej sieti však nie je biologický neurón v plnom zmysle. Je matematickou funkciou, ktorá kombinuje vstupy a aplikuje nelinearitu. Analógia bola produktívna, no doslovné porovnávanie dnešných sietí s mozgom zostáva zavádzajúce.
Frank Rosenblatt v roku 1958 predstavil perceptrón ako systém, ktorý upravuje váhy pri klasifikácii. Podstatný posun spočíval v tom, že vývojár neurčil každú vlastnosť pravidlom. Algoritmus sa z označených príkladov naučil hranicu medzi triedami. Tento princíp - parametre optimalizované podľa chyby - je základom oveľa zložitejších modelov.
Jednovrstvový perceptrón vie reprezentovať iba lineárne oddeliteľné hranice. Kniha Minskyho a Paperta z roku 1969 systematicky analyzovala limity, pričom verejná interpretácia často zovšeobecnila kritiku na neurónové siete vôbec. Spolu s nenaplnenými sľubmi a nedostatočným výkonom to prispelo k poklesu záujmu.
Poučenie nie je, že kritici „zastavili pokrok“. Výskum potreboval viacvrstvové architektúry, efektívne učenie, výpočty a dáta. História perceptrónu ukazuje opakujúci sa cyklus AI: korektná základná idea, príliš široká marketingová interpretácia, odhalenie hraníc a neskorší návrat v lepších podmienkach.
1956 a vznik odboru s názvom artificial intelligence
- Dartmouthský návrh pomenoval spoločný výskumný program a ambíciu opísať učenie i inteligenciu tak presne, aby ich mohol simulovať stroj.
- Názov spojil rôzne tradície - logiku, kybernetiku, neurónové modely, jazyk a riešenie problémov - no zároveň podporil široké očakávania.
- Založenie odboru bolo inštitucionálnym prelomom: vytvorilo komunitu, financovanie, konferencie a spoločný slovník.
John McCarthy, Marvin Minsky, Nathaniel Rochester a Claude Shannon navrhli letný výskumný projekt v Dartmouthe na rok 1956. Formulácia vychádzala z predpokladu, že každý aspekt učenia alebo inteligencie možno v princípe opísať tak presne, aby ho stroj simuloval. Workshop nevytvoril hotovú teóriu inteligencie, ale pomohol etablovať názov artificial intelligence.
Pomenovanie má vedecké aj rétorické následky. „Umelá inteligencia“ priťahuje otázky o ľudskej mysli, hoci mnohé systémy riešia úzku optimalizačnú úlohu. Alternatívne tradície hovorili o automatike, kybernetike, rozpoznávaní vzorov alebo spracovaní informácií. Hranice medzi nimi boli spoločenské rovnako ako technické.
Vytvorenie identity odboru umožnilo sústredené granty a laboratóriá. Súčasne vznikol tlak sľubovať rýchly pokrok k všeobecnej inteligencii. Keď sa predpovede nenaplnili, nasledovali obdobia poklesu financovania známe ako „AI winters“. Tieto zimy nemali jednu príčinu: kombinovali nedostatočný hardvér, dátové limity, krehkosť systémov a rozdiel medzi prototypom a nasadením.
Inštitucionalizácia je sama technologickou silou. Výskumný odbor potrebuje študentov, zdieľané problémy, publikačné normy a kapitál. Rovnako dnešnú AI neurčuje iba architektúra, ale ekosystém firiem, univerzít a verejných investícií.
Symbolická AI: logika, plánovanie a explicitné poznanie
- Symbolické systémy reprezentujú objekty, vzťahy a pravidlá v explicitnej forme a odvodzujú z nich závery.
- Priniesli plánovanie, dokazovanie viet, vyhľadávanie v stavovom priestore a jazyky vhodné na manipuláciu so symbolmi.
- Ich silou je kontrolovateľná štruktúra; slabinou náročné získavanie poznania a krehkosť mimo predpokladaného sveta.
V prvých desaťročiach dominovala predstava, že inteligencia vzniká manipuláciou so symbolmi. Program dostane reprezentáciu sveta, cieľ a pravidlá; vyhľadáva postup alebo dôkaz. General Problem Solver, logické programovanie a plánovacie systémy ukázali, že stroj môže riešiť formálne úlohy, ktoré sa predtým spájali s ľudským rozumom.
Kľúčovým objavom nebol iba konkrétny program, ale reprezentácia poznania. Spôsob, akým sa svet zapíše, určuje, ktoré závery sa dajú efektívne odvodiť. Ak je pravidlo explicitné, možno ho skontrolovať a zmeniť. Systém však nevie automaticky získať všetky výnimky, význam bežných slov ani implicitný spoločenský kontext.
Problém rámca ukázal, aké ťažké je formálne opísať, čo sa po udalosti nemení. Kombinatorická explózia zas znamená, že počet možností rastie príliš rýchlo na úplné prehľadanie. Heuristiky pomáhajú, no vnášajú doménové predpoklady. Reálny svet je otvorenejší než šachovnica.
Symbolická AI nezmizla. Pravidlá riadia prístup, konfigurácie, databázové dotazy, verifikáciu a plánovanie. Moderné hybridné systémy kombinujú jazykový model s vyhľadávaním, programom alebo formálnym kontrolórom. Dnešné volanie po „neuro-symbolickej“ AI je uznaním, že naučená flexibilita a explicitná kontrola riešia odlišné časti problému.
Expertné systémy: prvá veľká komerčná vlna
- Expertné systémy oddelili bázu doménových pravidiel od odvodzovacieho mechanizmu a preniesli časť expertízy do softvéru.
- DENDRAL, MYCIN a neskoršie priemyselné systémy ukázali vysoký výkon v úzko vymedzenom prostredí.
- „Úzke hrdlo získavania znalostí“, nákladná údržba a krehkosť pri výnimkách obmedzili škálovanie.
DENDRAL pomáhal chemikom odvodzovať molekulové štruktúry, MYCIN odporúčal antibiotickú liečbu v experimentálnom kontexte a XCON konfiguroval počítačové systémy. Ich úspech nevychádzal zo všeobecného rozumu, ale zo zachytenia kvalitných pravidiel a obmedzenia problému. V správnom kontexte mohli dosahovať výkon porovnateľný s odborníkmi.
Architektúra expertného systému mala znalostnú bázu, pracovnú pamäť a inference engine. Niektoré systémy vedeli uviesť reťaz pravidiel, ktorým dospeli k odporúčaniu. To je iný druh vysvetliteľnosti než post-hoc vysvetlenie neurónového modelu. Ak sú pravidlá kompletné a korektné, ich logiku možno auditovať.
Ťažké bolo pravidlá z expertov získať, formalizovať a udržiavať. Odborník často nevie verbalizovať tacitné poznanie; dvaja experti sa nezhodnú; zmena produktu vyvolá reťaz úprav. S rastom bázy vznikajú konflikty a nepredvídané interakcie. Systém tiež nevie rozumne improvizovať mimo zakódovaného rozsahu.
Komerčný pokles expertných systémov prispel k ďalšej AI zime, no ich organizačné poučenia sú aktuálne. Aj dnešný asistent potrebuje vlastníka znalostí, aktualizáciu, hranice použitia a eskaláciu. Retrieval-augmented generation, rozobratá nižšie, rieši časť problému iným spôsobom: znalosti uchováva v dokumentoch a relevantné časti poskytne modelu pri otázke.
Pravdepodobnosť, Bayesovské siete a neistota
- Pravdepodobnostné modely umožnili reprezentovať neistotu namiesto predstierania, že všetky pravidlá sú absolútne.
- Bayesovské siete vyjadrujú podmienené závislosti medzi premennými a podporujú aktualizáciu presvedčení podľa dôkazov.
- Tento prelom spojil AI so štatistikou a rozhodovaním, no správna štruktúra a kauzálna interpretácia zostávajú náročné.
Reálny svet poskytuje neúplné a hlučné pozorovania. Symptóm nezaručuje diagnózu, senzor má chybu a slovo môže mať viac významov. Pravdepodobnostný prístup reprezentuje distribúciu možností. Bayesovo pravidlo ukazuje, ako sa po novom dôkaze mení pravdepodobnosť hypotézy.
Bayesovské siete používajú orientovaný graf a lokálne podmienené pravdepodobnosti. Vhodná faktorácia znižuje zložitosť a umožňuje inferenciu o nepozorovaných premenných. Model môže napríklad spojiť príčinu, poruchu senzora a pozorovaný alarm. Explicitne ukáže, ktoré nezávislosti predpokladá.
Pravdepodobnostný model však nie je automaticky kauzálny. Korelácia a smer šípky musia vychádzať z dizajnu, znalosti alebo intervenčných dát. Neistota parametrov, výber modelu a posun distribúcie môžu spôsobiť falošnú istotu. Kalibrácia - zhoda deklarovanej pravdepodobnosti s frekvenciou výsledku - je preto dôležitá.
Táto tradícia zostáva základom filtrovania spamu, diagnostiky, robotiky, prognóz a riadenia rizík. Moderné neurónové modely často generujú distribúciu ďalšieho tokenu, hoci ich interná reprezentácia je omnoho väčšia. Pochopenie pravdepodobnosti z kapitoly 4 je nevyhnutné na správnu interpretáciu ich sebavedomo znejúceho textu.
Štatistické učenie a metódy s pevnejšími zárukami
- Štatistická teória učenia presunula pozornosť k generalizácii: výkonu na dátach, ktoré model počas tréningu nevidel.
- Support vector machines, regularizácia, rozhodovacie stromy a ensemble metódy vytvorili silné praktické nástroje ešte pred dominanciou hlbokých sietí.
- „Klasické“ ML zostáva vhodnejšie pri mnohých tabuľkových, menších a lepšie kontrolovaných problémoch.
Kľúčová otázka strojového učenia neznie, či model zapamätá tréningové dáta, ale či sa naučí štruktúru prenositeľnú na nové prípady. Pojmy tréningová, validačná a testovacia množina, bias-variance trade-off a regularizácia vytvorili disciplínu hodnotenia generalizácie.
Support vector machines hľadajú deliacu hranicu s veľkou rezervou a pomocou kernelov reprezentujú nelineárne vzťahy bez explicitného výpočtu veľmi rozmerného priestoru. Rozhodovacie stromy poskytujú pravidlá delenia; random forests a gradient boosting kombinujú viac slabších modelov do silného celku. Tieto metódy zmenili klasifikáciu, scoring, bioinformatiku a priemyselné predikcie.
Hlboké učenie nevymazalo štatistickú tradíciu. Na tabuľkových dátach, pri malej vzorke, potrebe nižšej latencie alebo jednoduchšieho auditu môže gradient boosting poraziť oveľa väčší model. Kvalitná baseline je preto povinnou súčasťou vývoja v kapitole 10.
Prelom spočíval aj v kultúre dôkazu: oddelené testy, krížová validácia a porovnateľné metriky. Rovnaká kultúra však neskôr vytvorila riziko „učenia sa na benchmark“ - komunita opakovane optimalizuje na známy test, až prestane reprezentovať širší cieľ.
1986 a návrat viacvrstvových neurónových sietí
- Spätné šírenie chyby poskytlo praktický spôsob výpočtu gradientov vo viacvrstvových sieťach.
- Skryté vrstvy sa mohli naučiť interné reprezentácie namiesto ručného definovania každej vlastnosti.
- Algoritmus nebol jediným objavom ani okamžitým riešením; plný účinok čakal na lepšie dáta, výpočty, aktivácie a optimalizáciu.
Článok Rumelharta, Hintona a Williamsa z roku 1986 popularizoval učenie interných reprezentácií pomocou spätného šírenia chyby. Výstupná chyba sa pomocou reťazového pravidla prenesie cez vrstvy a určí, ako zmeniť každý parameter. Gradientný zostup potom znižuje zvolenú stratovú funkciu.
Backpropagation má staršie matematické a technické korene; história sa nemá redukovať na jedného autora. Jeho význam spočíva v praktickom spojení viacvrstvovej architektúry, diferencovateľnej funkcie a učenia z dát. Sieť si mohla vytvoriť medzireprezentácie, ktoré neboli priamo označené.
Tréning hlbokých sietí však narážal na miznúce alebo explodujúce gradienty, málo dát, pomalý hardvér a nestabilnú optimalizáciu. V 90. rokoch často dominovali iné metódy. To opäť ukazuje, že algoritmický princíp môže byť známy dlho pred svojím infraštruktúrnym prelomom.
Dnes automatická diferenciácia vo frameworkoch skryje technický detail, no reťazové pravidlo zostáva motorom tréningu. Model sa „neučí“ ako človek, ktorý pochopí lekciu; optimalizuje parametre podľa agregovanej chyby. Tento rozdiel je jadrom kapitoly 4.
Konvolučné a rekurentné siete: štruktúra obrazu a sekvencie
- Konvolučné siete využívajú lokálnosť a zdieľanie váh, takže efektívnejšie spracúvajú obraz.
- Rekurentné siete zdieľajú stav naprieč krokmi a modelujú sekvencie; LSTM zmiernilo problém dlhodobejších závislostí.
- Architektonický predpoklad, teda inductive bias, môže dramaticky znížiť množstvo potrebných dát a výpočtov.
Konvolučná vrstva posúva rovnaký filter po obraze. Namiesto samostatného parametra pre každú polohu zdieľa váhy a využíva fakt, že hrana je užitočným vzorom bez ohľadu na miesto. LeNet ukázal praktické rozpoznávanie rukou písaných číslic a položil základ neskoršej revolúcii počítačového videnia.
Rekurentná sieť spracúva postupnosť krok za krokom a prenáša skrytý stav. LSTM z roku 1997 zaviedlo brány, ktoré regulujú uchovanie a zabudnutie informácie, čím zlepšilo učenie dlhších závislostí. RNN a LSTM sa stali základom rozpoznávania reči, prekladu a časových radov pred transformermi.
Tieto architektúry ilustrujú inductive bias: návrh modelu obsahuje predpoklad o štruktúre sveta. CNN predpokladá lokálne vzory a určitú translačnú stabilitu; RNN sekvenčnosť. Transformer používa slabší lokálny predpoklad a viac sa spolieha na dáta a mierku. Žiadna architektúra nie je úplne „bez predpokladov“.
Prelomom teda nie je len viac vrstiev. Je ním vhodné obmedzenie priestoru riešení. Správny bias zvyšuje dátovú efektívnosť; nesprávny môže skryť dôležitú štruktúru. Vo vývoji sa preto architektúra volí podľa modality a prevádzkových podmienok, nie podľa popularity.
Dáta, internet a benchmarky ako motor pokroku
- Veľké označené datasety umožnili porovnávať algoritmy a trénovať modely s vysokou kapacitou.
- Internet sprístupnil nebývalé množstvo textu, obrazu a ľudskej interakcie, ale aj skreslenia, osobné údaje a spory o práva.
- Benchmark koordinuje výskum, no po čase sa môže stať cieľom sám osebe a prestať merať reálnu schopnosť.
MNIST štandardizoval rozpoznávanie číslic; ImageNet zhromaždil milióny označených obrázkov v tisícoch kategórií. Súťaž ImageNet Large Scale Visual Recognition Challenge vytvorila spoločný test, na ktorom bolo vidieť rýchly pokrok. Dataset bol súčasne výsledkom obrovskej ľudskej práce a kategorizácie, nie prirodzenou „surovinou“ bez hodnôt.
Web poskytol textové korpusy v rozsahu, ktorý staršie jazykové systémy nemali. Vyhľadávače, preklad a reklama vytvorili ekonomický dôvod budovať infraštruktúru strojového učenia. Neskoršie foundation models využili rozsiahle zmesi webu, kníh, kódu a ďalších zdrojov. Ich kvalita aj riziká preto odzrkadľujú pôvod dát.
Zdieľaný benchmark urýchľuje iteráciu: každý tím nemusí vytvárať vlastný test a výsledky sú aspoň čiastočne porovnateľné. Súčasne podporuje Goodhartov zákon - keď sa metrika stane cieľom, prestáva byť dobrou mierou. Únik testových položiek do tréningu, prelaďovanie na jednu sadu a ignorovanie nákladov môžu vytvoriť ilúziu všeobecného pokroku.
Moderná evaluácia preto potrebuje dynamické, súkromné a doménové testy, analýzu skupín, ľudské hodnotenie a reálnu prevádzku. Kapitola 9 vysvetľuje, prečo vysoké skóre nie je zárukou bezpečného systému.
GPU, distribuované výpočty a softvérová infraštruktúra
- Paralelná aritmetika grafických procesorov sa ukázala ako mimoriadne vhodná na maticové operácie neurónových sietí.
- Distribuovaný tréning, rýchle prepojenia, frameworky a cloud zmenili experiment z individuálneho kódu na priemyselný proces.
- Výpočtová kapacita zrýchlila pokrok, ale vytvorila koncentráciu, energetické nároky a závislosť od dodávateľského reťazca.
GPU boli navrhnuté na paralelné spracovanie grafiky. Tréning neurónových sietí používa veľké množstvo podobných maticových operácií, takže sa na ne hodili lepšie než všeobecné CPU. Programovacie platformy a knižnice postupne umožnili vedcom využiť túto kapacitu bez písania každého nízkoúrovňového kroku.
Pri veľkých modeloch nestačí jeden čip. Tréning sa delí podľa dát, parametrov alebo častí výpočtového grafu. Potrebné sú presné algoritmy komunikácie, správa pamäte, zmiešaná numerická presnosť, checkpointy a obnovenie po chybe. Prelom je teda aj v systémovom inžinierstve, ktoré vedecký článok nemusí plne zachytiť.
Frameworky ako TensorFlow, PyTorch a JAX znížili bariéru experimentovania pomocou automatickej diferenciácie, akcelerátorov a zdieľaných komponentov. Cloud umožnil prenajať výpočet, ale najväčšie tréningy zostávajú dostupné iba organizáciám s veľkým kapitálom a dodávkami čipov.
Výpočty nie sú neutrálne pozadie. Ovplyvňujú, kto môže overiť výsledok, aké otázky sa výskumu oplatí skúmať a kde sa sústreďuje moc. Energetickú a geopolitickú stránku rozoberie kapitola 13.
Čítajte mapu od východiska cez súvislosť až po dôsledok. Spoločným jadrom je „Dáta + výpočty + architektúra“.
2012: AlexNet a zlom v počítačovom videní
- AlexNet spojil hlbokú konvolučnú sieť, GPU, veľký označený dataset, vhodnú regularizáciu a tréningové postupy.
- Výrazne znížil chybovosť v súťaži ImageNet a presvedčil širšiu komunitu o škálovateľnosti hlbokého učenia.
- Prelom nebol dôkazom ľudského videnia; model stále závisel od kategórií, distribúcie dát a štatistických skratiek.
AlexNet od Krizhevského, Sutskevera a Hintona vyhral ILSVRC 2012 s výrazným náskokom. Použil viacvrstvovú CNN, ReLU aktivácie, dropout, augmentáciu dát a tréning na GPU. Každá zložka mala predchodcov, no ich spojenie v správnej chvíli vytvorilo presvedčivý výsledok.
Účinok presiahol jednu súťaž. Výskumné tímy presunuli pozornosť k hlbokým sieťam, firmy investovali do GPU a datasety i benchmarky získali ešte väčšiu úlohu. Prenosové učenie umožnilo použiť reprezentácie naučené na veľkom datasete aj pri menšej úlohe.
Modely však mohli využívať pozadie, textúru či iný korelát namiesto objektu v ľudskom zmysle. Malá cielene navrhnutá zmena vstupu dokázala spôsobiť nesprávnu klasifikáciu. Úspech na prirodzenom benchmarku preto otvoril výskum robustnosti a adversariálnych príkladov.
AlexNet je učebnicovým príkladom súbehu: myšlienka CNN, dostupnosť ImageNetu, výpočty GPU, optimalizačné triky a súťažná metrika. Označiť ktorýkoľvek prvok za jedinú príčinu by skreslilo dejiny.
Hlbšie siete, residual connections a prenosové učenie
- S rastúcou hĺbkou vznikol problém optimalizácie; residual connections umožnili vrstvám učiť sa zmeny oproti identite.
- ResNet ukázal, že stovky vrstiev možno účinne trénovať a prenášať ich reprezentácie do ďalších úloh.
- Transfer learning znížil potrebu trénovať každý model od nuly a predznamenal dnešné foundation models.
Intuícia „viac vrstiev znamená lepší model“ narazila na degradačný problém: hlbšia sieť mohla mať vyššiu tréningovú chybu, hoci by teoreticky vedela reprezentovať aspoň identitu navyše. ResNet z roku 2015/2016 zaviedol skratkové spojenia, cez ktoré informácia a gradient prechádzajú jednoduchšou cestou. Blok sa učí reziduálnu funkciu, teda zmenu oproti vstupu.
Tento návrh zlepšil optimalizáciu veľmi hlbokých sietí a ovplyvnil mnoho ďalších architektúr. Podstatný je všeobecný princíp: architektúra môže meniť učiace sa vlastnosti systému, nielen jeho teoretickú kapacitu. Dva modely schopné reprezentovať rovnakú funkciu nemusia byť rovnako trénovateľné.
Predtrénovaná obrazová sieť sa mohla následne doladiť na medicínske snímky, výrobnú kontrolu alebo segmentáciu s menším datasetom. Skoršie vrstvy zachytili všeobecnejšie vizuálne vzory a neskoršie sa prispôsobili úlohe. To zmenilo ekonomiku vývoja: organizácia už nepotrebovala milión označených príkladov pre každý projekt.
Transfer learning vytvoril most k univerzálnejším predtrénovaným modelom. Namiesto jedného modelu na jednu úlohu vznikol veľký základ a množstvo adaptácií. Rovnaký princíp je jadrom BERTu, GPT a dnešných multimodálnych modelov.
2014: generatívne adversariálne siete
- GAN spojil generátor a diskriminátor do súťaže, v ktorej sa model učí vytvárať vzorky podobné dátam.
- Metóda zásadne zlepšila realistickú syntézu obrazu a rozvinula výskum generatívneho modelovania.
- Tréning môže byť nestabilný a model môže ignorovať časť distribúcie; realizmus navyše otvoril problém deepfakov.
V generative adversarial network proti sebe stoja dva modely. Generátor vytvára vzorky a diskriminátor sa učí rozlíšiť ich od reálnych. Generátor zlepšuje výstup tak, aby diskriminátor oklamal. Teoreticky hra smeruje k distribúcii, ktorú diskriminátor nerozozná od dát.
GAN-y rýchlo posunuli kvalitu syntetických tvárí, štýlového prenosu a úprav obrazu. Ukázali, že neurónová sieť nemusí iba klasifikovať; môže modelovať distribúciu a tvoriť nové vzorky. To bol dôležitý predchodca dnešnej generatívnej vlny, hoci mechanizmus jazykových a difúznych modelov je odlišný.
Optimalizácia dvoch súperiacich sietí je citlivá. Pri mode collapse generátor vytvára obmedzenú množinu typov, hoci vyzerajú realisticky. Výsledok sa ťažko hodnotí jedným číslom a malé zmeny tréningu môžu destabilizovať rovnováhu. Výskum priniesol množstvo variantov strát a architektúr.
Schopnosť generovať fotorealistický obsah zvýraznila dual-use povahu AI. Rovnaká metóda pomáha pri tvorbe, simulácii a ochrane súkromia, no umožňuje manipuláciu identity. Technický prelom preto vytvára aj potrebu provenance, mediálnej gramotnosti a pravidiel, ktoré sa vrátia v kapitole 15.
Reinforcement learning: učenie konania zo spätnej väzby
- Posilňované učenie optimalizuje postupnosť rozhodnutí podľa odmeny, nie iba správnosť jednotlivého označeného príkladu.
- Hodnota, politika, explorácia a oneskorená odmena umožňujú modelovať agenta v prostredí.
- Nesprávne navrhnutá odmena vedie k reward hackingu: systém splní metriku spôsobom, ktorý odporuje zámeru.
V reinforcement learning agent pozoruje stav, vykoná akciu, dostane odmenu a prejde do ďalšieho stavu. Cieľom je maximalizovať očakávanú kumulatívnu odmenu. Ťažké je priradiť neskorší úspech skorším rozhodnutiam a vyvažovať exploráciu nových možností s využívaním známej stratégie.
Q-learning a ďalšie metódy sa snažia odhadnúť hodnotu akcie alebo priamo optimalizovať politiku. Pri zložitom vstupe sa tabuľka stavov stáva nemožnou; neurónová sieť môže aproximovať hodnotovú funkciu. Tým sa otvorila cesta k deep reinforcement learning.
Odmena je zjednodušený zástupca cieľa. Agent môže nájsť nečakanú skratku, ktorá maximalizuje skóre bez želaného správania. V simulácii ide o poučný bug, v reálnom systéme o bezpečnostné riziko. Preto nestačí „dať AI správny cieľ“ - hodnoty a pravidlá sa nedajú vždy úplne zapísať do jednej funkcie.
Reinforcement learning sa využíva v robotike, logistike, hrách, odporúčacích systémoch a neskôr pri dolaďovaní jazykových modelov. Pri každom prenose zo simulácie treba riešiť rozdiel reality, bezpečnú exploráciu a zodpovednosť za akcie.
2013-2016: DQN, AlphaGo a spojenie učenia s vyhľadávaním
- Deep Q-Network ukázala, že jedna neurónová sieť sa môže učiť viac hier priamo z pixelov a odmien.
- AlphaGo spojilo hlboké siete, posilňované učenie a Monte Carlo tree search v systéme, ktorý porazil špičkových ľudských hráčov.
- Úspech v uzavretej hre bol vedeckým míľnikom, nie dôkazom všeobecnej inteligencie.
DeepMind v práci o DQN spojil konvolučnú sieť s Q-learningom pre hry Atari. Experience replay narušil koreláciu po sebe idúcich skúseností a target network stabilizovala cieľ. Agent sa učil z obrazovky a skóre bez ručne navrhnutých vlastností pre každú hru.
Go bolo dlho považované za mimoriadne ťažké pre obrovský priestor možností a náročné hodnotenie pozície. AlphaGo použilo policy network na výber sľubných ťahov, value network na odhad pozície a stromové vyhľadávanie na plánovanie. V roku 2016 porazilo Lee Sedola 4 : 1. AlphaGo Zero neskôr ukázalo silu self-play bez ľudských herných záznamov, ak sú pravidlá a odmena presne dostupné.
Systém ukázal hodnotu kombinácie učenia a vyhľadávania. Naučená intuícia zúži priestor; explicitné plánovanie preverí varianty. Podobný princíp sa objavuje pri dnešných modeloch používajúcich nástroje a testovanie kandidátnych riešení.
Go je však plne pozorovateľné, pravidlá sa nemenia a víťazstvo je jasné. Pracovný, politický alebo morálny problém tieto vlastnosti nemá. Preniesť slovo „nadľudský“ z jednej hry na celkovú inteligenciu je mýtus, ktorému sa venuje kapitola 5.
Distribuované reprezentácie slov a seq2seq
- Word embeddings reprezentovali slová ako vektory, ktorých geometria zachytáva štatistické podobnosti použitia.
- Sequence-to-sequence modely sa učili mapovať celú vstupnú sekvenciu na výstupnú, čo výrazne zlepšilo neurónový preklad.
- Vektorová podobnosť nie je úplný význam; embeddings prenášajú aj stereotypy a frekvencie tréningového korpusu.
Word2vec a príbuzné metódy ukázali, že predikcia okolitého slova vytvorí užitočné reprezentácie bez ručného slovníka vlastností. Slová používané v podobnom kontexte dostanú blízke vektory. Analógie vo vektorovom priestore sa stali pôsobivou demonštráciou distribuovanej reprezentácie.
Statistický kontext však nie je totožný s pravdivou definíciou ani ľudským porozumením. Ak korpus spája profesiu s rodom alebo etnicitou, geometria vzťah zachytí. Debiasing môže znížiť konkrétnu metriku, no spoločenské kategórie a význam sa nedajú jednoducho vymazať jedným smerom v priestore.
Seq2seq architektúry použili encoder na kompresiu vstupu do reprezentácie a decoder na generovanie výstupu. Umožnili end-to-end neurónový preklad bez samostatného ručného návrhu každej jazykovej fázy. Pri dlhých vetách však pevný kontextový vektor vytváral úzke hrdlo.
Riešením sa stal attention: decoder pri každom kroku váži relevantné časti vstupu. Táto myšlienka pripravila pôdu pre Transformer, ktorý odstránil rekurentné spracovanie ako hlavný mechanizmus.
2014-2017: attention a Transformer
- Attention umožňuje modelu dynamicky vážiť vzťahy medzi prvkami sekvencie namiesto stlačenia všetkého do jedného stavu.
- Transformer založil spracovanie sekvencie na self-attention a feed-forward vrstvách, čo výrazne zlepšilo paralelizáciu tréningu.
- Architektúra sa stala univerzálnym základom textových, obrazových, zvukových, biologických a multimodálnych modelov.
Attention v neurónovom preklade riešil problém dlhého vstupu tým, že decoder vytvoril pre každý výstup vážený súčet reprezentácií vstupných slov. Váhy sa naučili spolu s modelom. Nejde automaticky o ľudsky verné vysvetlenie rozhodnutia; je to výpočtový mechanizmus prenosu informácie.
Práca Attention Is All You Need z roku 2017 predstavila Transformer. Self-attention porovnáva tokeny v rámci tej istej sekvencie prostredníctvom query, key a value reprezentácií. Multi-head attention umožňuje súčasne zachytávať rôzne typy vzťahov. Pozičná informácia dopĺňa poradie, ktoré samotný attention neobsahuje.
Na rozdiel od RNN môže Transformer počas tréningu spracovať veľa tokenov paralelne. To lepšie využíva GPU a akcelerátory a umožnilo škálovanie. Nevýhodou základného attention je kvadratický rast práce s dĺžkou kontextu, čo motivovalo efektívnejšie varianty a systémové optimalizácie.
Prelomová bola modularita. Rovnaký základ možno použiť ako encoder, decoder alebo ich kombináciu a prispôsobiť inej modalite. Transformer však sám nevytvoril ChatGPT. Potreboval predtréning na masívnych dátach, škálovacie zákony, dolaďovanie, ľudské preferencie, infraštruktúru a produktové rozhranie.
2018: BERT a kontextový predtréning
- BERT predtrénoval bidirekcionálny Transformer na neoznačenom texte a následne ho dolaďoval na množstvo úloh.
- Jedna kontextová reprezentácia nahradila samostatné feature engineering pipeline pre mnohé jazykové problémy.
- Predtréning vytvoril základný model, ale neodstránil potrebu doménových dát, testovania ani analýzy skreslení.
Staršie embeddings dávali slovu prevažne jeden vektor bez ohľadu na vetu. BERT vytvára reprezentáciu tokenu v kontexte z oboch strán. Pri masked language modeling zakryje časť tokenov a predikuje ich podľa okolia. Tak využíva veľký neoznačený korpus, hoci výber a príprava korpusu zostávajú ľudským rozhodnutím.
Po predtréningu stačila menšia označená množina na klasifikáciu, otázky a odpovede či rozpoznanie entít. Tento model pretrain-fine-tune dramaticky zmenil NLP. Tímy prestali pre každú úlohu od začiatku navrhovať vlastnú architektúru a reprezentácie.
BERT je prevažne encoder a nie je navrhnutý ako autoregresívny konverzačný generátor. Jeho úspech však ukázal hodnotu všeobecného jazykového predtréningu. Spolu s GPT vetvou vytvoril dnešnú predstavu foundation modelu, ktorý sa adaptuje na mnoho následných použití.
Rovnaký základ môže šíriť chyby medzi aplikáciami. Ak predtrénovaný model obsahuje skreslenie alebo bezpečnostnú slabinu, zdedia ju desiatky downstream systémov. Centralizácia zvyšuje efektívnosť aj systémové riziko.
GPT, autoregresia a in-context learning
- GPT rodina kombinuje Transformer decoder s predikciou nasledujúceho tokenu a generuje text postupne.
- S rastúcim modelom a dátami sa objavila schopnosť riešiť viac úloh z pokynu a príkladov bez klasického dolaďovania každej z nich.
- In-context learning mení správanie počas inferencie, nie uložené parametre; môže byť pôsobivé, ale citlivé na formuláciu a poradie príkladov.
GPT-1 v roku 2018 ukázal generatívny predtréning a následné dolaďovanie. GPT-2 zvýšil mierku a zdôraznil zero-shot prenos. GPT-3 v roku 2020 demonštroval few-shot správanie: používateľ vloží do promptu niekoľko príkladov a model pokračuje podľa vzoru bez aktualizácie parametrov.
Autoregresívny model sa učí distribúciu ďalšieho tokenu vzhľadom na predchádzajúci kontext. Pri generovaní opakuje predikciu, vyberie token a pridá ho k vstupu. Jednoduchý tréningový cieľ na obrovskom množstve dát núti model vytvoriť reprezentácie syntaxe, štýlu, faktických asociácií, kódu a ďalších vzorov.
Schopnosť vykonať úlohu z prirodzeného pokynu znížila integračnú bariéru. Namiesto špecializovaného rozhrania stačil text. To je technický aj produktový prelom. Model však môže pokračovať pravdepodobným tvrdením bez opory; mechanizmus optimalizuje predikciu, nie pravdivosť. Halucinácie preto nie sú iba kozmetická chyba rozhrania.
In-context learning nie je trvalé učenie človeka ani automatická aktualizácia znalostí. Po skončení kontextu parametre zostávajú rovnaké. Dlhý kontext navyše nezaručuje, že model využije každý detail správne. Praktické použitie vysvetľuje kapitola 7.
Škálovacie zákony a éra foundation models
- Empirické scaling laws opisujú pravidelné zlepšovanie straty pri raste parametrov, dát a výpočtov v určitom rozsahu.
- Škálovanie zmenilo výskum na kapitálovo a infraštruktúrne náročnú disciplínu a podporilo modely použiteľné na mnoho úloh.
- Krivka straty nie je zákonom inteligencie: nevie sama predpovedať spoľahlivosť, bezpečnosť, ekonomickú hodnotu ani ďalší kvalitatívny skok.
Práca Kaplana a kolegov z roku 2020 kvantifikovala power-law vzťahy medzi stratou a mierkou modelu, datasetu a výpočtov. Neskorší výskum upravoval výpočtovo optimálny pomer dát a parametrov. Organizácie získali nástroj na plánovanie veľkých tréningov: od menších behov možno odhadovať návratnosť ďalších výpočtov.
Stanfordský pojem foundation model pomenoval model trénovaný na širokých dátach, ktorý sa adaptuje na množstvo downstream úloh. Jediný základ poskytuje jazyk, obraz, kód či multimodálne rozhranie mnohým produktom. To zvyšuje znovupoužiteľnosť a umožňuje nové aplikácie bez tréningu od nuly.
Rovnaká vlastnosť vytvára homogenizáciu. Chyba jedného základu sa môže prejaviť v zdravotnom, finančnom aj vzdelávacom produkte. Downstream tím často nepozná tréningové dáta ani zmenu verzie. Governance sa preto musí rozšíriť z jedného modelu na dodávateľský reťazec.
Scaling law platí pre konkrétnu metriku, architektúru a rozsah merania. Nehovorí, že každý dvojnásobok výpočtu prinesie nový druh rozumu ani že mierka je jediná cesta. Dátová kvalita, efektívnejšie učenie, nástroje, syntetické dáta a architektúra môžu meniť krivku. Ekonomické a energetické limity navyše nie sú súčasťou tréningovej straty.
Instruction tuning a ľudská spätná väzba
- Predikcia nasledujúceho tokenu nevytvára automaticky užitočného asistenta; model treba prispôsobiť pokynom a preferenciám.
- Supervised fine-tuning učí vzorové odpovede a RLHF používa ľudské porovnania na vytvorenie modelu odmeny.
- Alignment zlepšuje ovládateľnosť, no ľudská spätná väzba je obmedzená kultúrou, pravidlami, anotátormi a schopnosťou posúdiť odbornú pravdu.
Základný jazykový model pokračuje v texte. Nemusí vedieť, či má odpovedať, citovať, odmietnuť alebo položiť otázku. Instruction tuning používa páry pokynov a želaných odpovedí, aby sa naučil formát asistenta. Neskoršie postupy kombinujú syntetické inštrukcie, expertné dáta a rôzne optimalizačné algoritmy.
InstructGPT opísal pipeline, v ktorej ľudia najprv vytvorili ukážky, potom porovnávali viac odpovedí. Z preferencií sa naučil reward model a politika sa optimalizovala pomocou reinforcement learning. Menší prispôsobený model mohol byť používateľmi preferovaný pred oveľa väčším neprispôsobeným základom.
RLHF neodovzdáva modelu úplnú ľudskú morálku ani pravdu. Anotátor môže hodnotiť štýl, nie správnosť špecializovanej odpovede; pokyny definujú, čo sa považuje za bezpečné; rozdielne komunity majú odlišné normy. Model sa môže naučiť znieť užitočne a súhlasne, čo niekedy zvyšuje presvedčivosť omylu.
Prelom bol napriek limitom zásadný: z predtrénovaného generátora sa stal ovládateľnejší konverzačný produkt. Rozhranie a feedback loop umožnili miliónom ľudí odhaliť nové schopnosti aj chyby. Produktové používanie sa tak stalo ďalším zdrojom výskumných otázok.
Difúzne modely a nová generácia syntézy obrazu
- Difúzny model sa učí obrátiť postupné pridávanie šumu a z náhodného vstupu rekonštruovať štruktúrovanú vzorku.
- Latent diffusion presunula proces do komprimovaného priestoru a výrazne znížila výpočtové náklady generovania vysokého rozlíšenia.
- Textové podmieňovanie otvorilo masové tvorivé použitie, ale aj otázky tréningových práv, autenticity a práce tvorcov.
Denoising diffusion probabilistic models definujú dopredný proces, ktorý dáta postupne zašumí, a naučený spätný proces, ktorý šum odstraňuje. Model opakovane odhaduje smer k pravdepodobnejšej vzorke. Na rozdiel od GAN nepoužíva rovnakú súperiacu hru a tréning býva stabilnejší, hoci generovanie vyžaduje viac krokov.
Latent diffusion najprv komprimuje obraz autoencoderom a difúziu vykonáva v latentnom priestore. Model tak pracuje s menšou reprezentáciou a dekóder ju prevedie späť na pixely. Cross-attention spája textové reprezentácie s obrazovým generovaním. Tento súbeh umožnil široko dostupné text-to-image systémy.
Kvalita obrazu nevypovedá o fyzikálnom porozumení. Model kombinuje naučené vizuálne pravidelnosti a môže zlyhať pri počítaní, priestorových vzťahoch alebo konzistentnej identite. Generovaný obsah tiež nesie štatistické stopy datasetu a môže reprodukovať stereotyp či prvok podobný dielu autora.
Difúzne modely ukázali, že generatívna revolúcia nie je iba jazyková. Spoločné rozhranie promptu spojilo modality a pripravilo pôdu pre multimodálne modely, ktoré obraz nielen vytvárajú, ale aj interpretujú.
Prelom zvyčajne vzniká spojením viacerých technických posunov. Náčrt použite ako krátku kontrolu pred praktickým rozhodnutím.
Multimodalita a spoločné reprezentačné priestory
- Multimodálne modely prepájajú text, obraz, zvuk, video alebo akcie a učia sa vzťahy medzi modalitami.
- CLIP ukázal silu kontrastívneho učenia z párov obraz-text a zero-shot klasifikácie prirodzenými názvami.
- Viac modalít rozširuje kontext aj útočnú plochu; chyba v jednej vrstve môže ovplyvniť rozhodnutie v druhej.
CLIP sa učil priblížiť reprezentácie správneho obrázka a textového popisu a oddialiť nesprávne páry. Namiesto pevného zoznamu tried mohol obrázok porovnať s ľubovoľnými textovými opismi. Tak vzniklo flexibilnejšie rozhranie medzi jazykom a videním.
Neskoršie systémy kombinujú vision encoder s jazykovým modelom alebo tokenizujú viac modalít v spoločnej architektúre. Používateľ pošle fotografiu dokumentu, hlasovú otázku či video a dostane jazykovú odpoveď alebo akciu. Multimodalita približuje AI reálnym pracovným tokom, kde informácia nie je iba čistý text.
Spoločná reprezentácia však môže zameniť vizuálnu koreláciu za fakt a jazyková plynulosť prekryje chybu v rozpoznaní. Obrázok môže obsahovať skrytý textový pokyn určený pre model, zvuk hlasovú imitáciu a dokument citlivé metadata. Bezpečnostný model sa preto musí zaoberať celým vstupným kanálom.
Multimodalita je dôležitá aj pre robotiku, ale obraz a text nestačia na bezpečné telesné konanie. Robot potrebuje priestorový stav, senzory, riadenie, fyzické obmedzenia a fail-safe mechanizmy. Schopnosť opísať scénu nie je schopnosť bezpečne v nej konať.
RAG, nástroje a návrat explicitného systému
- Retrieval-augmented generation poskytuje modelu pri otázke vybrané externé dokumenty namiesto spoliehania sa iba na parametre.
- Tool use umožňuje volať kalkulačku, databázu, vyhľadávanie alebo program a kombinovať generovanie s deterministickou operáciou.
- Spoľahlivosť závisí od celého systému: indexu, oprávnení, výberu zdroja, orchestrace, modelu a kontroly výsledku.
RAG najprv vyhľadá relevantné pasáže a vloží ich do kontextu generátora. Znalosti možno aktualizovať bez opätovného tréningu a odpoveď môže uviesť zdroj. To je praktický prelom pre podnikové asistenty, pretože interné dokumenty sa menia častejšie než základný model.
RAG nezaručuje pravdu. Retriever môže nájsť nesprávny alebo zastaraný dokument, chunking rozdeliť podmienku od výnimky a generátor zdroj skresliť. Citácia môže byť reálna, no nepodporovať vetu. Evaluácia preto oddelene meria vyhľadanie, groundedness, odpoveď a oprávnenia.
Tool use rieši slabiny jazykového modelu delegovaním. Kalkulačka počíta, databáza poskytne aktuálny záznam, kompilátor otestuje kód. Model rozhoduje, ktorý nástroj a argument použiť. Ak má možnosť vykonať akciu, chyba už nie je iba nesprávnym textom; môže meniť dáta alebo poslať správu.
Moderná AI sa tak opäť stáva hybridným systémom explicitných a naučených komponentov. Ako vysvetľuje kapitola 10, používateľ nikdy neinteraguje iba s modelom. Kvalita vzniká v architektúre celého pracovného toku.
Agenti: od odpovede k viacstupňovému konaniu
- Agentný systém rozkladá cieľ, volí nástroje, uchováva stav, kontroluje výsledok a pokračuje cez viac krokov.
- Dlhší horizont násobí pravdepodobnosť chyby a zvyšuje význam oprávnení, pozorovateľnosti a možnosti prerušenia.
- Súčasné agentné schopnosti sú sľubné, no nerovnomerné; autonómia sa má prideľovať podľa rizika a dôkazov.
Jazykový model tradične vytvorí jednu odpoveď. Agentná slučka pozoruje stav, plánuje krok, volá nástroj, číta výsledok a aktualizuje plán. Pamäť uchováva relevantné fakty a orchestrátor určuje pravidlá. Testy, kritici alebo viac kandidátov môžu zvýšiť úspešnosť.
Ak má každý krok 95-percentnú pravdepodobnosť správnosti a úloha potrebuje dvadsať závislých krokov, naivný súčin je približne 36 %. Kroky samozrejme nie sú nezávislé a kontrola môže chyby opraviť, no príklad ukazuje problém horizontu. Jedna skorá chyba zmení celý ďalší kontext.
Bezpečný agent používa minimálne oprávnenia, sandbox, limity nákladov, allowlist nástrojov, potvrdenie nezvratnej akcie a kompletný auditný záznam. Webový alebo dokumentový prompt injection môže presvedčiť model, aby nasledoval pokyn z nedôveryhodného obsahu. Oddeliť dáta od inštrukcií je preto zásadné.
Agenti sú ďalším stupňom medzi schopnosťou a pracovným dopadom z kapitoly 11. Autonómne vykonanie môže zmeniť proces viac než generovanie návrhu, no organizačný prah bude vyšší. Demonštrácia úspešnej rezervácie nie je dôkazom robustnej prevádzky vo všetkých výnimkách.
AlphaFold2: prelom mimo textu a obrazu
- AlphaFold2 výrazne zlepšil predikciu trojrozmernej štruktúry proteínu z aminokyselinovej sekvencie.
- Systém spojil doménovú reprezentáciu, attention, evolučné informácie a geometrické obmedzenia.
- Predikovaná štruktúra je vedecký nástroj, nie úplná simulácia biológie ani automaticky hotový liek.
V súťaži CASP14 dosiahol AlphaFold2 bezprecedentnú presnosť pri mnohých cieľoch a článok v Nature z roku 2021 podrobne opísal architektúru. Model iteratívne spracúva viacnásobné zarovnania sekvencií a párové vzťahy a generuje priestorovú štruktúru s odhadom istoty.
Prelom ukázal, že metódy hlbokého učenia môžu urýchliť vedeckú infraštruktúru, nie iba spotrebiteľský obsah. Zverejnenie rozsiahlej databázy predikcií sprístupnilo hypotézy výskumníkom po svete. Hodnota vznikla kombináciou modelu, kurátorovaných biologických dát, výpočtov a otvoreného prístupu k výsledkom.
Proteín však funguje v bunkovom prostredí, mení konformáciu a interaguje s ďalšími molekulami. Štruktúra je dôležitá, no nie jediná informácia. Experimentálna validácia a doménový výskum zostávajú potrebné. Ani vysoká istota pre časť štruktúry nie je zárukou každej biologickej funkcie.
AlphaFold vyvažuje verejný obraz AI: najdôležitejší prelom nemusí mať konverzačné rozhranie. Vedecké modely pre molekuly, materiály, počasie a fyzikálne simulácie môžu mať veľký spoločenský dopad, hoci ich bežný používateľ priamo nevidí.
ChatGPT ako produktový a spoločenský prelom
- ChatGPT nespočíval na úplne novej jedinej architektúre; spojil veľký jazykový model, instruction tuning, RLHF a jednoduché konverzačné rozhranie.
- Prirodzený jazyk znížil bariéru použitia a masová spätná väzba odhalila schopnosti aj riziká v nebývalom rozsahu.
- Popularita produktu nie je vedeckou metrikou, no zmenila investície, pracovné postupy, vzdelávanie a verejnú politiku.
Keď bol ChatGPT verejne sprístupnený v novembri 2022, jeho základné komponenty mali verejne známych predchodcov. Prelomom bolo ich zabalenie do dostupného dialógu. Používateľ nepotreboval API, dataset ani programovanie. Mohol iterovať, opravovať zadanie a aplikovať model na vlastný problém.
Konverzácia vytvorila pocit partnera a zároveň zvýšila antropomorfizáciu. Model používa prvú osobu, udržiava kontext a reaguje sociálne primerane, preto ľudia ľahšie pripisujú úmysel či porozumenie. Práve rozdiel medzi rozhraním a mechanizmom je jednou z hlavných tém celej série.
Masová adopcia presunula AI z oddelenia dát do kancelárie, školy a domácnosti. Vznikli nové integrácie, konkurenčné modely, pravidlá a výskum dopadov. Organizácie zistili, že všeobecný nástroj môže zrýchliť prototyp, no bezpečné produkčné nasadenie vyžaduje lifecycle z kapitoly 10.
ChatGPT je preto prelomom podobným webovému prehliadaču: technologické základy existovali, ale rozhranie spojilo infraštruktúru s masovým správaním. Túto analógiu a jej limity rozvinie kapitola 14.
Otvorené modely, reprodukovateľnosť a ekosystém
- Zverejnený kód, váhy, datasety a evaluačné nástroje urýchľujú experimentovanie, lokalizáciu a nezávislú kontrolu.
- „Open source AI“ nemá vždy rovnaký rozsah otvorenosti; licencia na váhy nemusí sprístupniť dáta ani tréningový proces.
- Otvorenosť rozptyľuje inovácie, ale môže znížiť bariéru zneužitia a nemení fyzickú koncentráciu výpočtov.
Frameworky, repozitáre modelov a otvorené publikácie umožnili univerzitám a malým firmám stavať na spoločných komponentoch. Výskumník môže doladiť dostupný model pre slovenčinu, medicínsku terminológiu alebo lokálnu verejnú službu bez vlastného frontier tréningu.
Pojem „otvorený“ treba rozložiť. Môže ísť o otvorený článok, zdrojový kód inferencie, tréningový kód, váhy, dataset, evaluačný súbor alebo právo komerčne meniť a redistribuovať. Ak chýbajú dáta a výpočtový recept, výsledok sa nedá plne reprodukovať, hoci váhy možno používať.
Otvorené modely podporujú súkromné on-premise nasadenie a audit, no bezpečnosť nevzniká automaticky. Organizácia preberá aktualizácie, monitoring a incidenty. Výkonné váhy môžu byť upravené bez centrálnej ochrany; hodnotenie rizika preto zvažuje schopnosť, dostupné návody a reálnu škálovateľnosť škody.
Ekosystém je historický prelom, pretože mení tempo kombinovania nápadov. Kto ho vedie, nemožno posúdiť iba podľa najlepšieho uzavretého modelu. Kapitola 13 preto zahrnie otvorenosť ako samostatnú dimenziu pretekov.
Čo nebolo jedným prelomom: emergence, reasoning a „iskry AGI“
- Nová schopnosť môže byť pri väčšom modeli náhle viditeľná v diskrétnej metrike, hoci podkladové zlepšenie bolo plynulé.
- Výrazy ako reasoning alebo emergence označujú pozorované správanie, nie automaticky rovnaký vnútorný proces ako u človeka.
- Tvrdenie o všeobecnej inteligencii vyžaduje širší a odolnejší dôkaz než súbor vybraných úspešných príkladov.
Pri škálovaní sa niektoré schopnosti zdajú objaviť náhle. Ak metrika hodnotí odpoveď iba ako správnu alebo nesprávnu, plynulý rast pravdepodobnosti prekročí prah a graf vyzerá ako skok. Inokedy môže väčší model skutočne kombinovať reprezentácie novým spôsobom. Rozlíšenie si vyžaduje viac metrík, veľkostí a kontrolu kontaminácie.
Chain-of-thought prompting a dodatočný výpočet počas inferencie môžu zlepšiť riešenie viacstupňových úloh. Textový reťazec však nemusí byť vernou stopou interného procesu; model môže vytvoriť presvedčivé vysvetlenie po odpovedi. Správna odpoveď môže vzniknúť zo skratky a chybná napriek rozumnému postupu.
Pojem AGI nemá jednotnú operačnú definíciu, ako ukazuje kapitola 5. Vybrané testy z matematiky, práva a programovania dokazujú šírku naučených schopností, ale nie robustnú autonómiu v otvorenom svete, dlhodobé učenie, ukotvenie ani zodpovednosť.
Odborný jazyk má preto používať konkrétne tvrdenia: model dosiahol výsledok X na teste Y za podmienok Z. Metafora môže pomôcť orientácii, no nesmie nahradiť meranie.
Ako sa prelomy merajú a prečo sa rebríčky rýchlo kazia
- Benchmark musí reprezentovať cieľovú schopnosť, mať čisté testovacie dáta a uvádzať náklady, variabilitu aj podmienky.
- Saturácia, kontaminácia a optimalizácia na test znižujú jeho rozlišovaciu schopnosť.
- Reálne hodnotenie kombinuje automatické metriky, expertov, adversariálne testy a pozorovanie v kontexte použitia.
Historický prelom sa často vyhlasuje podľa poklesu chybovosti na benchmarku. To je oprávnené, ak test je vopred definovaný, výsledok reprodukovateľný a rozdiel prakticky významný. Porovnanie sa rozpadá, ak modely používajú odlišné nástroje, počet pokusov, externé dáta alebo neohlásený výber najlepšej odpovede.
Pri jazykových modeloch môže byť testová otázka alebo jej parafráza v tréningovom korpuse. Benchmark sa po publikovaní stáva obsahom webu a budúce modely ho absorbujú. Dynamické a neverejné sady znižujú problém, no komplikujú reprodukovateľnosť. Žiadna jedna tabuľka ho úplne nerieši.
Ľudské hodnotenie zachytí užitočnosť a štýl, ale je drahé, variabilné a citlivé na presvedčivosť. Model-as-a-judge škáluje, no môže preferovať vlastný štýl alebo zdieľať chybu hodnoteného modelu. Kritické úlohy vyžadujú kvalifikovaného doménového experta a meranie následku.
Najdôležitejšou zmenou je prechod od modelovej evaluácie k systémovej evaluácii. RAG, nástroje, rozhranie a človek menia výsledok. Prelom v benchmarku je iba kandidátom na prelom v praxi.
Vzor, ktorý sa opakuje
- Najväčšie skoky vznikajú pri spojení reprezentácie, optimalizácie, dát, výpočtov a spätnej väzby.
- Každá nová schopnosť presúva úzke hrdlo: z pravidiel na dáta, z dát na výpočty, z modelu na integráciu alebo z výkonu na dôveru.
- Po prelome nasleduje fáza precenenia, učenia sa z chýb a budovania doplnkových inštitúcií.
Symbolická AI potrebovala ručne zapísané poznanie. Strojové učenie ho čiastočne získalo z označených príkladov. Self-supervised learning využilo samotnú štruktúru masívnych neoznačených dát. Foundation models presunuli problém k výpočtom, kurácii, evaluačným metódam a bezpečnej adaptácii.
Keď model dosiahne dostatočnú kvalitu, hlavnou prekážkou sa stane proces. Organizácia potrebuje oprávnenia, aktuálne zdroje, zodpovednosť a používateľské rozhranie. Keď sa integrácia rozšíri, objavia sa otázky koncentrácie, práce, energie a regulácie. Technologická hranica sa teda posúva spolu so spoločenskou.
Opakuje sa aj cyklus hype. Úspech v úzkom prostredí sa interpretuje všeobecne, investície rastú, limity sa ukážu a časť očakávaní klesne. Výskum však pokračuje a komponenty nájdu stabilné použitie. AI zima preto neznamenala, že všetko pred ňou bolo bez hodnoty, rovnako ako dnešný boom nezaručuje každú predpoveď.
Odborná orientácia vyžaduje oddeliť trvalý mechanizmus od dočasnej značky. Backpropagation, attention, transfer learning, retrieval a evaluačná disciplína pravdepodobne pretrvajú v ďalších kombináciách, aj keď názvy produktov a vedúce organizácie sa zmenia.
Čo môže byť ďalším prelomom
- Kandidátmi sú spoľahlivejšie plánovanie, dátovo a energeticky efektívnejšie učenie, dlhodobá pamäť, robotika a AI pre vedu.
- Skutočný prelom musí preukázať robustnosť mimo vybraného benchmarku a praktickú integráciu za prijateľné náklady.
- Budúce objavy nemožno spoľahlivo časovať; preto je rozumnejšie sledovať technické a systémové indikátory než odvážne dátumy AGI.
Jednou líniou je test-time compute: model počas riešenia generuje, overuje a vyberá viac kandidátov. Druhou sú svetové modely a robotika, ktoré spájajú vnímanie s fyzickou akciou. Treťou je efektívnosť - menšie modely, sparsita, kvantizácia a lepšie dáta môžu sprístupniť schopnosti mimo najväčších dátových centier.
AI pre vedu môže navrhovať molekuly, materiály, experimenty a hypotézy. Prelom nastane, ak systém opakovane vytvorí nové, experimentálne potvrdené poznanie a skráti celý vedecký cyklus, nie iba reprodukuje literatúru. Potrebná je integrácia s laboratóriami a mechanizmus na zachytenie negatívnych výsledkov.
Ďalšou hranicou je spoľahlivosť: kalibrovaná neistota, formálna verifikácia komponentov, robustná práca s nástrojmi a učenie bez katastrofického zabúdania. Menej efektné zníženie chybovosti z jedného percenta na promile môže byť pre zdravotníctvo alebo infraštruktúru dôležitejšie než nový kreatívny trik.
Predpovedať konkrétny rok všeobecnej inteligencie nie je dôsledkom scaling law. Sledujme radšej dĺžku autonómne zvládnutej úlohy, prenos do nového prostredia, cenu spoľahlivého výkonu, potrebu ľudských opráv a výskyt závažných zlyhaní. Tieto indikátory spájajú schopnosť s realitou.
Čo z toho vyplýva
- Dnešná AI nie je náhly vynález jednej firmy, ale vrstva vytvorená z mnohých verejných, akademických a priemyselných príspevkov.
- Najdôležitejšia inovácia často spočíva v kombinácii starších komponentov a v odstránení úzkeho hrdla.
- Historická gramotnosť chráni pred mýtom nevyhnutného lineárneho pokroku aj pred tvrdením, že ide iba o prechodnú módnu vlnu.
Od Turingovej formalizácie cez symboly, pravdepodobnosť, spätné šírenie, benchmarky, GPU, Transformer, predtréning, ľudskú spätnú väzbu až po nástroje vedie sieť závislostí. Bez dát by veľký model nemal čo komprimovať, bez hardvéru by sa nedal trénovať, bez evaluácie by sme nepoznali pokrok a bez rozhrania by sa schopnosť nestala masovou službou.
Prelom nie je automaticky pokrok pre spoločnosť. Generovanie obrazu môže rozšíriť tvorbu aj narušiť informačné prostredie; produktivita môže zlepšiť prácu aj sústrediť výnos. Technická história preto ústi do ekonomiky a politiky.
Nasledujúca kapitola 13 rozloží otázku vedenia na výskum, modely, čipy, výpočty, energiu, talent, kapitál, otvorený ekosystém a difúziu. Kapitola 14 vysvetlí, prečo kombinácia týchto prelomov vytvára všeobecne použiteľnú infraštruktúru, a kapitola 15 ukáže, ako sa na jej rýchlu zmenu pripraviť bez technologického fatalizmu.
Zdroje a ďalšie čítanie
- Alan Turing: On Computable Numbers, with an Application to the Entscheidungsproblem
- Alan Turing: Computing Machinery and Intelligence - Turing Digital Archive
- McCarthy, Minsky, Rochester a Shannon: A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence
- Rosenblatt: The Perceptron - A Probabilistic Model for Information Storage and Organization in the Brain
- Weizenbaum: ELIZA
- Rumelhart, Hinton a Williams: Learning Representations by Back-propagating Errors
- Hochreiter a Schmidhuber: Long Short-Term Memory
- Cortes a Vapnik: Support-Vector Networks
- Deng et al.: ImageNet - A Large-Scale Hierarchical Image Database
- Krizhevsky, Sutskever a Hinton: ImageNet Classification with Deep Convolutional Neural Networks
- He et al.: Deep Residual Learning for Image Recognition
- Mikolov et al.: Efficient Estimation of Word Representations in Vector Space
- Sutskever, Vinyals a Le: Sequence to Sequence Learning with Neural Networks
- Bahdanau, Cho a Bengio: Neural Machine Translation by Jointly Learning to Align and Translate
- Goodfellow et al.: Generative Adversarial Nets
- Mnih et al.: Human-level Control through Deep Reinforcement Learning
- Silver et al.: Mastering the Game of Go with Deep Neural Networks and Tree Search
- Vaswani et al.: Attention Is All You Need
- Devlin et al.: BERT - Pre-training of Deep Bidirectional Transformers for Language Understanding
- Radford et al.: Improving Language Understanding by Generative Pre-Training
- Brown et al.: Language Models are Few-Shot Learners
- Kaplan et al.: Scaling Laws for Neural Language Models
- Bommasani et al.: On the Opportunities and Risks of Foundation Models
- Ouyang et al.: Training Language Models to Follow Instructions with Human Feedback
- Ho, Jain a Abbeel: Denoising Diffusion Probabilistic Models
- Rombach et al.: High-Resolution Image Synthesis with Latent Diffusion Models
- Radford et al.: Learning Transferable Visual Models From Natural Language Supervision - CLIP
- Lewis et al.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
- Jumper et al.: Highly Accurate Protein Structure Prediction with AlphaFold
- Stanford HAI: AI Index Report 2026 - Research and Development
- NIST: Artificial Intelligence Risk Management Framework
Praktické odpovede
Často kladené otázky
Ktorý objav bol pre dnešnú AI najdôležitejší?
Neexistuje jediný. Dnešné systémy spájajú neurónové siete, spätné šírenie chyby, špecializovaný hardvér, veľké dáta, transformery a ďalšie metódy.
Prečo boli GPU dôležité pre AI?
Umožnili efektívne vykonávať veľké množstvo paralelných matematických operácií potrebných pri tréningu neurónových sietí.
Čo zmenil transformer?
Priniesol efektívny mechanizmus práce so vzťahmi v sekvencii a umožnil škálovať tréning jazykových modelov na rozsiahle dáta a výpočty.
Najlepšie porozumenie vzniká, keď si zhrniete tri hlavné myšlienky vlastnými slovami.
Prihlásiť / registrovať