Úvod do AI pre každého

Ako sa AI učí z dát

Začiatočník20 min čítania27 častíZadarmo

Odborné overenie: čaká na potvrdenie Miroslava Schmiedta. Stav k 4. októbru 2026.

Lekcia04
Učenie modeluPríklady menia parametre
01Tréningové dáta
02Chyba
03Úprava váh
04Opakovanie

Model sa učí počas tréningu, nie každým bežným rozhovorom.

Tréning hľadá použiteľné vzťahy v príkladoch. Výsledok treba hodnotiť aj na nových údajoch: zapamätanie tréningových príkladov ešte nie je schopnosť zovšeobecniť.

Po prečítaní budete vedieť

  • vysvetliť hlavný princíp na vlastnom príklade
  • rozlíšiť údaj, odhad a vykonanú akciu
  • určiť, čo treba pred použitím výsledku skontrolovať

Obchod chce odhadnúť, koľko pečiva predá zajtra. Má záznamy o predaji, dňoch v týždni a otváracích hodinách. Nestačí ich nahrať do ľubovoľného nástroja a očakávať spoľahlivú odpoveď. Najprv treba určiť, čo presne sa odhaduje, ktoré údaje budú dostupné v čase rozhodnutia a ako sa úspešnosť overí.

Učenie z dát je výpočtový proces, pri ktorom sa parametre modelu upravujú podľa príkladov a cieľa. Táto kapitola sleduje celý postup na modelovej predajni. Čísla a situácie slúžia na vysvetlenie; nejde o údaje skutočného podniku.

Úloha musí byť presná skôr než dáta

„Zlepšiť predaj“ je obchodná ambícia, nie dostatočne určená úloha modelu. „Odhadnúť počet predaných kusov na ďalší deň“ je presnejšie zadanie. Vieme pomenovať vstup, požadovaný výstup aj čas, ku ktorému má odhad vzniknúť.

Ani predaj sa nemusí rovnať dopytu. Ak predajňa objedná málo pečiva a vypredá ho dopoludnia, záznam ukáže počet predaných kusov. Neobsahuje všetkých zákazníkov, ktorí by ešte nakúpili. Model trénovaný iba na predaji môže preberať obmedzenie zásob.

Tento rozdiel má praktický význam. Ak chceme rozhodovať o objednávke, potrebujeme poznať aj vypredanie a prípadné neuspokojené objednávky. Kvalitný model nespraví z nedostatočného záznamu úplný obraz reality.

Pred zberom dát preto treba zodpovedať, čo výsledok označuje. Počet predaných kusov, záujem zákazníkov a optimálna objednávka sú tri súvisiace, ale odlišné veci.

Jeden riadok dát predstavuje konkrétny prípad

V tabuľke môže jeden riadok predstavovať jeden deň. Stĺpce obsahujú dátum, deň v týždni, otvorenie predajne, cenu a počet predaných kusov. V inom projekte môže riadok predstavovať správu, fotografiu alebo zákaznícku požiadavku.

Jednotku pozorovania musíme určiť dôsledne. Ak zmiešame denný predaj jednej predajne s mesačným predajom inej, porovnanie nebude zmysluplné. Chyba tu vzniká ešte pred tréningom.

Vstupné vlastnosti, často označované ako príznaky, sú údaje, ktoré model používa na vytvorenie odhadu. Cieľová hodnota je výsledok, ktorý sa má naučiť predikovať. Pri učení s učiteľom sú vstupy a známe výsledky spojené v príkladoch. Google: Supervised Learning.

Predajňa môže použiť deň v týždni a informáciu o zatvorení. Ak však plánuje objednávku večer, nemôže ako vstup používať skutočný počet zákazníkov nasledujúceho dňa. Ten v čase rozhodnutia nepozná.

Dáta sú meranie, nie samotná skutočnosť

Pokladničný systém môže spoľahlivo zaznamenávať platby, ale nie dôvody nákupu. Kamera môže zaznamenať obraz, ale nie všetko, čo je mimo záberu. Dotazník môže zachytiť odpoveď, ale jeho znenie a výber respondentov ovplyvnia význam výsledku.

Pri údajoch preto sledujeme pôvod a spôsob vzniku. Kto meral? Kedy? Akým nástrojom? V akých jednotkách? Chýbajúce hodnoty môžu mať rôzny význam: údaj nebol dostupný, udalosť nenastala alebo systém zlyhal.

V modelovej predajni chýbajúci predaj v nedeľu nemusí znamenať nulu. Predajňa mohla byť zatvorená, záznam nemusel doraziť alebo bol poškodený. Ak všetky prázdne bunky nahradíme nulou, môžeme vytvoriť nesprávny vzorec.

Aj označenie dát je ľudská činnosť. Dvaja ľudia sa nemusia zhodnúť, či je zákaznícka správa sarkastická alebo nespokojná. Pri nejasných kategóriách treba vytvoriť pravidlá označovania a skúmať zhodu hodnotiteľov.

Príprava údajov mení to, čo model vidí

Pred tréningom sa kontrolujú duplicity, formáty, jednotky a extrémne hodnoty. Duplicita nemusí byť chyba: dva rovnaké nákupy môžu byť skutočné. Chybná môže byť opakovane importovaná jedna platba. Rozhodnutie potrebuje kontext.

Číselné premenné sa v niektorých metódach upravujú na vhodnú mierku. Normalizácia alebo štandardizácia pomáha pri výpočtoch, kde rozdielne rozsahy vlastností ovplyvňujú učenie. Neznamená však opravu nesprávneho merania. Google: Numerical data, normalization.

Kategórie potrebujú vhodné kódovanie. Deň v týždni alebo typ výrobku nie je automaticky číselná veličina s rovnakým významom ako hmotnosť. Priradenie čísel kategóriám môže niektorým modelom vnucovať neexistujúce poradie. Jednou z možností je samostatný indikátor pre každú kategóriu. Google: Vocabulary and one-hot encoding.

Tieto kroky sa učia alebo nastavujú podľa tréningových údajov. Ak by sa do ich nastavovania použili aj informácie z budúceho testu, mohlo by sa skresliť hodnotenie. Aj príprava dát teda patrí do overovaného postupu.

Model hľadá vzťah, ktorý pomôže pri novom prípade

Pri jednoduchej predikcii si môžeme predstaviť model ako výpočtové pravidlo s nastaviteľnými číslami. Tréning mení tieto čísla tak, aby sa znižovala chyba podľa zvoleného kritéria. V zložitejšom modeli môže byť nastaviteľných parametrov veľmi veľa.

Ak model podhodnocuje sobotný predaj, učenie môže zmeniť príspevok informácie o sobote. Konkrétny postup závisí od metódy. Podstatné je, že model nedostáva kompletný slovný opis všetkých zákonitostí. Odvodzuje použiteľné vzťahy z príkladov.

Nie každý nájdený vzťah je príčinou. Ak predaj rastie počas miestneho podujatia, dátum môže byť užitočný signál. Samotný dátum však nespôsobuje záujem o pečivo. Model môže využívať súvislosť bez porozumenia mechanizmu.

Takáto súvislosť prestane pomáhať, ak sa podujatie presunie alebo zruší. Preto potrebujeme kontrolovať, či vzťah zachytený v minulých dátach zostáva použiteľný pri budúcom rozhodnutí.

Chyba je informácia pre výpočet

Stratová funkcia vyjadruje, ako sa meria odchýlka výstupu od cieľa. Pri číselnom odhade môže byť dôležitá veľkosť rozdielu. Pri triedení sa hodnotí správnosť kategórie alebo pravdepodobnostného odhadu. Nie všetky funkcie trestajú chyby rovnako.

V predajni je rozdiel medzi objednaním príliš malého a príliš veľkého množstva. Jedna chyba môže viesť k nespokojným zákazníkom, druhá k odpadu. Ak model hodnotíme iba priemernou matematickou odchýlkou, nemusíme ešte merať obchodný dôsledok.

Človek musí rozhodnúť, čo chce optimalizovať. Zníženie odpadu, dostupnosť výrobku a náklady sa môžu dostať do napätia. Model nevyrieši hodnotovú voľbu iba tým, že sa naučí vzorec v tabuľke.

Aj preto rozlišujeme kvalitu predikcie a kvalitu rozhodnutia. Dobrý odhad môže byť použitý nevhodným pravidlom. Slabší odhad môže byť prijateľný pri úlohe, kde je jednoduchá oprava a malý dôsledok chyby.

Tréningové, validačné a testovacie údaje

Ak model hodnotíme na rovnakých príkladoch, na ktorých sa učil, môžeme preceňovať jeho použiteľnosť. Potrebujeme údaje, ktoré neslúžili na učenie parametrov. Bežne rozlišujeme tréningovú časť, validačnú časť na výber nastavení a test na konečné posúdenie. Google: Dividing the original dataset.

V časových údajoch má význam poradie. Ak chceme predikovať budúci predaj, overovanie by malo napodobňovať takú situáciu. Náhodné premiešanie dní môže presunúť informácie z neskoršieho obdobia do tréningu a vytvoriť neprimerane priaznivý obraz.

Podobne pri fotografiách ľudí nestačí náhodne rozdeliť jednotlivé snímky, ak sa fotografie tej istej osoby objavia v oboch častiach a cieľom je výkon na nových osobách. Správna jednotka rozdelenia závisí od zamýšľaného použitia.

Test nemá byť priebežným učebným materiálom. Ak podľa neho opakovane vyberáme variant modelu, jeho výsledok prestáva byť nezávislou záverečnou skúškou. Názov súboru test tento problém neodstráni.

Únik informácií môže vytvoriť zdanlivý úspech

Únik dát vzniká, keď model alebo tréningový postup získa informáciu, ktorá by pri skutočnom použití nemala byť dostupná. Môže ísť o budúci údaj, prezradený výsledok alebo nesprávne premiešané prípady.

Predstavte si odhad, či zásielka dorazí načas. Ak medzi vstupmi zostane skutočný dátum doručenia, model má informáciu, ktorú v čase odoslania nepoznáme. Skóre môže vyzerať výborne, ale systém nepomôže pri plánovaní.

Aj nenápadný stĺpec môže prezrádzať cieľ. Interný kód vytvorený až po vyriešení reklamácie môže obsahovať výsledok. Model si potom osvojí administratívny dôsledok udalosti, hoci od neho požadujeme predbežný odhad.

Pri kontrole položte otázku pre každý vstup: budem tento údaj poznať v okamihu, keď potrebujem predikciu? Ak nie, do daného modelu nepatrí. Toto pravidlo je použiteľné aj bez programovania.

Preučenie a nedostatočné učenie

Preučený model sa príliš prispôsobí tréningovým príkladom a slabo zvláda nové. Môže zachytiť náhodné zvláštnosti namiesto vzťahov, ktoré zostávajú použiteľné. Nedostatočne naučený model zase nezachytí ani podstatnú štruktúru problému. Google: Overfitting.

V modelovej predajni by si príliš zložitý postup mohol zapamätať výnimočné dni. Jednoduchý model používajúci iba jednu stálu hodnotu by však ignoroval pravidelný rozdiel medzi pracovným dňom a víkendom. Potrebujeme primeranosť, nie maximálnu zložitosť.

Regularizácia označuje postupy, ktoré podporujú lepšie správanie na nových dátach napríklad obmedzovaním určitých vlastností modelu. Dôležitou možnosťou je aj zastavenie tréningu v primeranom čase. Účinnosť treba overovať; názov metódy nezaručuje dobrý výsledok. Google: L2 regularization.

Viac dát môže pomôcť, ak prinášajú relevantné a kvalitné prípady. Väčší počet rovnakých chýb alebo nereprezentatívnych ukážok nemusí problém vyriešiť. Rozsah súboru a jeho užitočnosť nie sú totožné.

Myšlienková mapaAko do seba zapadajú časti kapitoly
Jadro témyPríklady menia parametre
01VýchodiskoÚloha musí byť presná skôr než dáta
02SúvislosťMalý číselný príklad učenia a overenia
03DôsledokZhrnutie kapitoly

Čítajte mapu od východiska cez súvislosť až po dôsledok. Spoločným jadrom je „Príklady menia parametre“.

Základné riešenie poskytuje porovnanie

Pred náročným modelom má zmysel vytvoriť jednoduchý porovnávací postup. Predajňa môže používať priemer rovnakého dňa z posledných týždňov. Nový model by mal ukázať, čo oproti tomu zlepšuje.

Ak veľmi zložitý systém neprináša lepšie rozhodnutia, vyššie náklady nemusia mať opodstatnenie. Základné riešenie tiež pomáha odhaliť chyby v projekte: ak prekvapivo silno porazí pokročilý model, môže byť problém v príprave údajov alebo v nevhodnom cieli.

Porovnanie treba vykonať na rovnakých prípadoch a rovnakou metrikou. Inak nevieme, či rozdiel vyplýva z metódy alebo z odlišných podmienok. Jedna ukážka úspešného dňa nestačí na hodnotenie.

Nasadením sa práca nekončí

Po nasadení model dostáva nové vstupy. Predajňa môže zmeniť otváracie hodiny, sortiment alebo ceny. Vzťahy z minulosti sa nemusia zachovať. Zmena rozdelenia vstupov alebo vzťahu medzi vstupom a cieľom môže zhoršiť výsledky.

Monitorovanie preto sleduje kvalitu dát aj kvalitu odhadov. Treba vedieť, kedy sa dostane skutočný výsledok, kto ho porovná s predikciou a čo sa stane pri zhoršení. Niekedy je vhodné model pretrénovať, inokedy opraviť zber dát alebo zmeniť celý cieľ.

Model sa nemusí automaticky zlepšovať každou ďalšou udalosťou. Priebežné učenie je osobitne navrhnutý proces. Aj aktualizácia môže výsledok zhoršiť, ak nové údaje obsahujú systematickú chybu.

Dátový slovník: aby stĺpec znamenal to isté pre všetkých

Pred tréningom si pripravíme opis údajov. Pri každom stĺpci uvedieme význam, jednotku, spôsob zberu a čas dostupnosti. Tento jednoduchý dokument sa nazýva dátový slovník. Pomáha predísť situácii, keď dve osoby používajú rovnaký názov pre rozdielne údaje.

V modelovej predajni stĺpec predaj môže označovať počet kusov, tržbu alebo počet nákupov. Ak ho jeden človek chápe ako kusy a druhý ako eurá, model dostane nejasný cieľ. Výpočtový postup nevie bez ďalšej informácie túto nezhodu odstrániť.

Pri dátume treba určiť, či ide o deň nákupu, zaúčtovania alebo importu. Pri výrobku, či sa zaznamenáva kus alebo balenie. Pri cene, či obsahuje zľavu. Podrobnosti sú potrebné práve preto, aby sa výsledok dal spojiť so skutočnou činnosťou.

Opisujeme aj prázdne hodnoty. Ak prázdny údaj znamená chýbajúci import, nemôžeme ho používať rovnako ako nulový predaj. Ak znamená, že výrobok v daný deň nebol v ponuke, ide o ďalšiu odlišnú situáciu. Jedna vizuálne prázdna bunka môže skrývať viac významov.

Dátový slovník má obsahovať aj pravidlá zmien. Ak predajňa začne deliť jeden výrobok na dva varianty, historické a nové kódy nemusia byť priamo porovnateľné. Bez poznámky by model mohol zmenu evidencie interpretovať ako zmenu záujmu zákazníkov.

Takýto opis nepredstavuje zbytočnú administratívu. Umožňuje zopakovať prípravu, vysvetliť výstup a preveriť podozrivý výsledok. Ak vieme, čo číslo označuje, môžeme zistiť, či chyba vznikla pri meraní, prenose alebo v modeli.

Výber príkladov rozhoduje o rozsahu skúsenosti

Predajňa môže mať veľa záznamov z pracovných dní a málo zo sviatkov. Celkový počet riadkov vyzerá dostatočný, ale niektoré situácie sú slabo zastúpené. Model nemá rovnakú oporu pre všetky okolnosti iba preto, že tabuľka je dlhá.

Pri výbere dát sa pýtame, koho alebo čo záznamy predstavujú. Jedna pobočka nemusí reprezentovať všetky. Letné mesiace nemusia pokryť zimnú prevádzku. Záznamy od aktívnych zákazníkov nehovoria automaticky o ľuďoch, ktorí službu prestali používať.

Modelová organizácia zbiera spätnú väzbu iba cez online formulár. Výsledok opisuje ľudí, ktorí formulár použili. Nemusí zachytiť skúsenosť tých, ktorí nemajú vhodný prístup alebo nevedia, kde sa nachádza. Toto obmedzenie patrí k údajom, nie iba k technológii.

Vzorka má zodpovedať zamýšľanému použitiu. Ak model bude pracovať na viacerých typoch prípadov, treba ich primerane zastúpiť a osobitne hodnotiť. Zriedkavý prípad môže mať veľký praktický význam, aj keď málo ovplyvní priemerné skóre.

Niekedy nemožno potrebné prípady jednoducho doplniť. Potom je správne obmedziť rozsah použitia alebo označiť neistotu. Systém by nemal vytvárať rovnakú istotu v prostredí, ktoré jeho dáta nepokrývajú. Hranica dát je súčasťou hranice výsledku.

Malý číselný príklad učenia a overenia

Použime zámerne jednoduchý modelový súbor. Predajňa počas troch porovnateľných pondelkov predala osemdesiat, deväťdesiat a sto kusov. Priemer je deväťdesiat. Ako základný odhad pre ďalší pondelok môže poslúžiť táto hodnota.

Nasledujúci pondelok sa predá deväťdesiatšesť kusov. Absolútna chyba odhadu je šesť kusov. Toto číslo ešte nehovorí o kvalite celého systému. Poznáme iba jeden nový prípad. Potrebujeme viac dní a posúdenie, či zodpovedajú rozhodovaniu, ktoré chceme podporiť.

Ak sa v ďalších dňoch chyby menia, sledujeme ich rozdelenie. Model môže mať nízku priemernú chybu a občas veľké zlyhanie. Pre plánovanie môže byť dôležitejší tento výnimočný problém než drobná odchýlka bežného dňa.

Predstavme si druhý postup, ktorý využíva aj otváracie hodiny. Musíme ho overiť na rovnakých nových prípadoch. Ak porovnávame prvý na pokojných dňoch a druhý počas podujatia, nevieme, či rozdiel pochádza z modelu alebo podmienok.

Ďalším krokom je rozhodnutie o objednávke. Odhad deväťdesiatšesť kusov nemusí znamenať, že objednáme presne toto množstvo. Môžeme zohľadniť neistotu, minimálne balenie a cenu odpadu. Predikcia poskytuje vstup pre rozhodnutie; neurčuje všetky jeho podmienky.

Príklad obsahuje vlastné didaktické čísla. Jeho cieľom je rozlíšiť tréningový podklad, nový výsledok, chybu a následnú akciu. Takto možno pochopiť jadro modelovania aj bez pokročilej matematiky a bez predstavy, že model vie budúci predaj s istotou.

Korelácia pomáha odhadovať, ale nie vždy vysvetľuje

V modelovej tabuľke sa vyšší predaj spája s dlhšou otváracou dobou. Môže to byť užitočný vzťah. Nevieme však iba z tejto súvislosti určiť, o koľko by predaj vzrástol, keby sme otváraciu dobu zmenili v každej situácii.

Predajňa mohla byť otvorená dlhšie práve počas dňa, keď sa konalo podujatie. Návštevnosť aj hodiny súvisia s ďalšou okolnosťou. Model môže zachytiť kombináciu signálov bez toho, aby izoloval účinok jedného z nich.

Na predikciu môže taký vzťah postačovať, ak sa podmienky zachovajú. Na rozhodovanie o zásahu však potrebujeme ďalšie poznanie. Otázka „čo sa stane?“ a otázka „čo spôsobí naša zmena?“ majú rozdielne nároky na dôkaz.

Predstavte si, že model odporučí dlhšie otvorenie všetkých pobočiek, pretože ho v minulosti spájal s vyšším predajom. Bez kontroly môžeme platiť dlhšiu prevádzku aj tam, kde ďalší zákazníci neprídu. Dobrý historický odhad sa tak môže premeniť na slabé odporúčanie.

Pre začiatočníka je vhodná formulácia, že model sa učí vzťahy použiteľné podľa určitej úlohy. Nepovedzme automaticky, že odhalil príčinu. Pri príčinnej otázke potrebujeme návrh výskumu alebo inú oporu, ktorá zodpovedá práve tejto otázke.

Keď sa označovatelia nezhodnú

Pri učení z označených správ potrebujeme kategórie. Predstavme si tri: otázka, sťažnosť a pochvala. Správa „Ďakujem za rýchle doručenie, ale balenie bolo poškodené“ obsahuje pochvalu aj sťažnosť. Jeden hodnotiteľ zvolí prvú kategóriu, druhý druhú.

Nezhoda nemusí znamenať, že niekto nepracoval pozorne. Môže odhaliť nevhodnú definíciu úlohy. Ak systém potrebuje odhaliť každú sťažnosť, môžeme povoliť viac označení. Ak musí vybrať oddelenie, potrebujeme pravidlo priority.

Príprava údajov preto zahŕňa jasný návod s príkladmi. Pravidlo má vysvetliť bežné aj nejednoznačné prípady. Časť správ možno označiť ako neisté a osobitne preveriť. Vynútená istota pri nejasnom cieli nepomáha modelu učiť sa vhodné rozdiely.

Overujeme aj zhodu medzi ľuďmi. Ak sa pri rovnakej správe opakovane rozchádzajú, model nemusí dosiahnuť zmysluplne jednotný výsledok bez zmeny zadania. Kategórie patria do návrhu projektu, nie iba do posledného stĺpca tabuľky.

V praktickom použití má byť možné nejednoznačný prípad poslať človeku. Nejde o zlyhanie všetkej automatizácie. Je to primeraný postup pre situáciu, pri ktorej samotný text neposkytuje jasnú odpoveď podľa určených pravidiel.

Syntetické dáta a upravené príklady

Niektoré projekty dopĺňajú dáta vytvorenými alebo upravenými príkladmi. Pri obraze môže ísť o zmenu jasu, mierne otočenie alebo výrez. Takéto úpravy sa často označujú ako augmentácia. Musia však zachovať význam potrebný pre úlohu.

Pri klasifikácii niektorých predmetov môže otočenie pomôcť. Pri čísliciach môže určité otočenie zmeniť alebo znejasniť cieľ. Pri texte nahradenie slova môže zmeniť náladu, zámer alebo faktický údaj. Rovnaká technika preto nie je vhodná pre všetky prípady.

Syntetický príklad môže byť aj úplne vytvorený. Je užitočný na skúšanie formátu alebo na simuláciu situácie. Nemôžeme však predpokladať, že automaticky verne reprezentuje skutočných používateľov. Môže preberať obmedzenia nástroja, ktorý ho vytvoril.

Modelová organizácia vygeneruje sto sťažností na tréning. Všetky majú podobnú dĺžku a zdvorilú štruktúru. Skutočné správy sú krátke, neúplné a obsahujú chyby. Veľkosť syntetického súboru neodstránila rozdiel medzi vytvoreným a reálnym obsahom.

Preto je potrebné overenie na nezávislých relevantných dátach. Syntetické dáta môžu byť časťou riešenia, ale nemajú slúžiť ako jediný dôkaz praktického výkonu. Musíme tiež sledovať, či úprava nepreniesla cieľ do vstupu alebo nevytvorila nereálnu skratku.

Verzie umožňujú zistiť, čo sa zmenilo

Model môže mať dobrý výsledok v jednom mesiaci a slabší v ďalšom. Potrebujeme vedieť, ktoré dáta, nastavenia a programy boli použité. Bez zaznamenaných verzií nevieme, či problém spôsobil nový model alebo zmena vstupov.

V modelovej predajni sa zmenil export pokladne. Stĺpec cena už obsahuje inú hodnotu. Ak si to tím nevšimne, môže slabší výsledok pripísať tréningu. Záznam zmien pomôže odhaliť, že sa zmenil význam jedného vstupu.

Reprodukovateľnosť znamená schopnosť zrekonštruovať podmienky experimentu. Nie každý výpočet musí byť úplne totožný, najmä ak používa náhodnosť. Potrebujeme však vedieť, čo sa vykonalo a podľa čoho sa výsledok hodnotil.

Zapisujeme zdroj údajov, pravidlá čistenia, rozdelenie prípadov a zvolenú metriku. Pri výsledku uvedieme aj rozsah testu. Takýto prehľad umožní novému človeku pochopiť projekt bez odkázanosti na pamäť jeho autora.

Pri nasadení je vhodné uchovať aj podklad pre návrat k predchádzajúcej funkčnej verzii. Aktualizácia nie je automaticky zlepšenie. Ak sa výkon zhorší, potrebujeme možnosť kontrolovaného zásahu a vysvetlenie, čo sa menilo.

Praktický náčrtOd pochopenia k bezpečnému použitiu
RozpoznajteTréningové dáta
PrepojteChyba
OverteOpakovanie

Model sa učí počas tréningu, nie každým bežným rozhovorom. Náčrt použite ako krátku kontrolu pred praktickým rozhodnutím.

Spätná väzba po nasadení nemusí byť úplná

Predajný model dostane skutočný výsledok po skončení dňa. Pri iných úlohách môže byť výsledok dostupný až neskôr alebo iba pri časti prípadov. To ovplyvňuje, ako sa dá merať výkon.

Modelová služba označuje požiadavky ako vyriešené. O spokojnosti sa dozvie iba od ľudí, ktorí vyplnia dotazník. Ak neodpovedajúci mali inú skúsenosť, získaná spätná väzba nemusí reprezentovať všetkých. Samotný počet hodnotení túto hranicu neodstraňuje.

Ďalší problém vzniká, keď rozhodnutie systému ovplyvní, ktoré výsledky uvidíme. Ak sa niektoré prípady nikdy neposunú na kontrolu, nemusíme zistiť, že boli nesprávne označené. Monitorovanie musí preto zahŕňať aj primerané preverovanie mimo automaticky vybraných prípadov.

Pri vysvetlení učenia je dôležité nepovedať, že každá nová interakcia okamžite opraví model. Potrebujeme najprv získať vhodnú spätnú väzbu, vyhodnotiť ju a rozhodnúť o aktualizácii. Bez tohto procesu nové záznamy nemusia zlepšiť nič.

Od požiadavky ku kontrolovanému experimentu

Predstavme si, že vedúci predajne chce znížiť počet vypredaní. Tím najprv určí, ktorý výrobok a aké obdobie rieši. Potom overí, či údaje zachytávajú sklad, predaj aj čas vypredania. Až následne stanoví konkrétnu predikčnú úlohu.

Ďalším krokom je jednoduché porovnávacie riešenie a plán hodnotenia. Model nesmie dostať údaje o budúcnosti. Test má zahŕňať obdobie, ktoré zodpovedá plánovanému použitiu. Výsledok sa hodnotí predtým, než sa podľa neho mení prevádzka.

Ak model pomáha, možno ho zaviesť najprv ako odporúčanie. Pracovník zaznamená, či odporúčanie použil a prečo ho zmenil. Tieto poznámky môžu odhaliť chýbajúci kontext, napríklad miestne podujatie alebo jednorazovú objednávku.

Postupné zavedenie umožňuje rozlíšiť výkon modelu a dôsledok rozhodnutia. Keď pracovník mení každé odporúčanie, problém nemusí byť iba v algoritme. Môže byť v nejasnom cieli alebo v tom, že systém nemá podstatnú informáciu.

Projekt učenia z dát tak nie je jednorazové nahratie tabuľky. Je to prepojenie otázky, merania, experimentu a praktického použitia. Každá časť poskytuje inú oporu. Ak jedna chýba, vysoké skóre samo osebe nezaručí užitočný výsledok.

Rozbor piatich odhadov

Nasledujúca tabuľka používa vymyslené hodnoty. Odhad vznikol vždy pred otvorením predajne. Skutočný predaj sa doplnil po skončení dňa. Znamienko rozdielu vypočítame ako odhad mínus skutočnosť, takže kladný rozdiel označuje nadhodnotenie. Absolútna chyba vyjadruje veľkosť odchýlky bez ohľadu na smer.

DeňOdhad kusovSkutočný predajRozdielAbsolútna chyba
Pondelok9096−66
Utorok807822
Streda858500
Štvrtok9094−44
Piatok100110−1010

Súčet absolútnych chýb je dvadsaťdva kusov. Po vydelení piatimi získame priemernú absolútnu chybu štyri celé štyri kusu na deň. Táto metrika opisuje veľkosť chyby v danom súbore. Nehovorí však, či je každá odchýlka pre prevádzku rovnako závažná.

Súčet podpísaných rozdielov je mínus osemnásť. Priemerný rozdiel je mínus tri celé šesť. V tejto malej ukážke teda model častejšie podhodnocuje. Tento výsledok môže viesť k prevereniu, ale päť dní ešte nestačí na všeobecný záver o dlhodobej kvalite.

Všimnite si aj piatok. Jedna chyba je väčšia než všetky ostatné. Priemerná hodnota ju môže zakryť. Ak bol v piatok veľký dopyt a predajňa sa skoro vypredala, skutočný neuspokojený záujem môže byť ešte vyšší než zaznamenaný predaj. Metrika nad dostupnými záznamami nemusí zachytiť celý problém.

Číselné hodnotenie preto kombinujeme s rozborom prípadov. Pri odľahlom výsledku hľadáme podklad: otváracie hodiny, dostupnosť výrobku alebo mimoriadnu udalosť. Model nevysvetlí príčinu iba tým, že vytvorí číslo. Potrebujeme vedieť, čo sa v konkrétnom dni skutočne stalo.

Nová pobočka môže vyžadovať nové overenie

Predajňa otvorí druhú pobočku. Používa rovnaké výrobky aj pokladničný program. To ešte neznamená rovnaký dopyt. Nové miesto môže mať odlišný pohyb ľudí, okolité prevádzky a čas návštev. Model naučený na prvej pobočke preto treba posúdiť podľa nového použitia.

Na začiatku môže poskytovať orientačný odhad, ale výsledok má byť označený primeranou neistotou. Zbierame nové dáta a porovnávame ich s očakávaním. Ak sa rozdiel pravidelne opakuje, treba zistiť, či stačí úprava alebo je potrebná odlišná reprezentácia úlohy.

Nesprávny postup by používal údaje novej pobočky na priebežné dolaďovanie a zároveň tvrdil, že test je úplne nezávislý. Keď sa z výsledku učíme, prestáva plniť pôvodnú úlohu záverečného overenia. Potrebujeme oddeliť prispôsobenie a následnú skúšku na ďalších prípadoch.

Pre začiatočníka je toto dobrý príklad významu slova generalizácia. Neznamená, že model musí fungovať všade. Znamená, že dokáže užitočne spracovať nové prípady v rozsahu, ktorý chceme preukázať. Rozsah sa nedá určiť iba názvom modelu alebo počtom tréningových riadkov.

Čo preveriť pri prekvapivo dobrom výsledku

Výsledok môže byť slabý, ale aj podozrivo dobrý. Ak model bez takmer akejkoľvek chyby odhaduje zložitú udalosť, skontrolujte, či sa cieľ neprezradil vo vstupoch. Vyhľadajte duplicity a overte časovú dostupnosť každého stĺpca.

Predstavte si predikciu vybavenia požiadavky. V tabuľke zostal dátum jej uzavretia. Už samotná prítomnosť tejto hodnoty môže odlišovať uzavreté prípady od ostatných. Model sa potom učí administratívny záznam výsledku, ktorý pri novej požiadavke ešte neexistuje.

Ďalšou možnosťou je rovnaký prípad v tréningu aj teste. Súbory sa môžu líšiť názvom, ale obsahovať zhodný text alebo fotografiu. Nezávislosť testu sa kontroluje podľa udalostí a vzťahov medzi prípadmi, nie iba podľa umiestnenia súboru.

Takáto kontrola neznehodnocuje úspech. Pomáha určiť, či je skutočný. Ak odhalí chybu, opravíme experiment a zopakujeme relevantné hodnotenie. Ak ju neodhalí, stále potrebujeme pochopiť, ktoré podmienky výsledok podporujú. Práve tieto podmienky rozhodujú, či možno model preniesť do plánovaného použitia.

Záznam experimentu na jednu stranu

Aj malý projekt má mať stručný záznam. Prvý odsek pomenuje otázku a okamih, keď sa výsledok potrebuje. Druhý uvedie jednotku pozorovania a cieľ. Ďalšia časť opíše dáta, ich pôvod a známe nedostatky. Potom nasleduje spôsob rozdelenia a hodnotenia.

Pri modelovej predajni môže záznam hovoriť o odhade denného počtu kusov pred večernou objednávkou. Zároveň uvedie, že vypredané dni neobsahujú úplný dopyt. Táto poznámka je podstatná pre interpretáciu. Bez nej by nový čitateľ mohol považovať predaj za nezávislé meranie záujmu.

Záznam obsahuje porovnávací postup. Ak používame priemer posledných pondelkov, uvedieme presné obdobie. Pri novom modeli opíšeme, ktoré vstupy navyše dostal. Porovnanie potom ukáže konkrétny prínos a umožní zistiť, či rozdiel nepochádza z odlišnej dostupnosti informácií.

Výsledok treba doplniť obmedzeniami. Môže byť vhodný pre bežné dni a slabo overený pri mimoriadnych udalostiach. Tím uvedie, čo sa pri takej udalosti stane. Možno odporúčanie posúdi pracovník, ktorý pozná miestny kontext a vie zvoliť inú objednávku.

Nakoniec sa zapíše rozhodnutie o ďalšom kroku. Nasadenie, ďalší zber dát alebo zmena úlohy sú odlišné závery. Dobré skóre nie je jediným možným výsledkom experimentu. Aj zistenie, že dostupné údaje nestačia, môže zabrániť nevhodnej investícii a pomôcť upraviť evidenciu.

Takýto dokument slúži spolupráci. Umožňuje vedúcemu pochopiť prínos, pracovníkovi pravidlá použitia a analytikovi podmienky výpočtu. Nevyžaduje veľa technického žargónu. Potrebuje presné pomenovania a otvorené uvedenie toho, čo sa zatiaľ neoverilo. Zrozumiteľnosť tu podporuje kontrolovateľnosť celého procesu.

Pred ďalším experimentom záznam porovnajte s novým plánom. Ak sa zmenil cieľ, nepoužívajte automaticky staré metriky. Ak sa zmenili dáta, overte ich význam. Tak zostáva každý výsledok spojený s otázkou, na ktorú skutočne odpovedá.

Cvičenie: skontrolujte projekt pred tréningom

Predajňa chce odhadnúť pondelkový predaj podľa údajov z posledného roka. V tabuľke sú denné tržby, otváracie hodiny, počet zákazníkov a konečný stav skladu. Odhad má vzniknúť v nedeľu večer. Ktoré údaje sú problematické?

Skutočný pondelkový počet zákazníkov a konečný stav skladu v čase odhadu nie sú známe. Historické hodnoty z minulých dní však môžu byť použiteľné, ak ich máme včas. Dôležité je rozlíšiť údaj o predchádzajúcom dni a údaj o dni, ktorý predikujeme.

Ďalej treba overiť zatvorené dni a vypredanie. Nulová tržba počas zatvorenia nepredstavuje nulový dopyt. Výsledný test by mal používať neskoršie obdobie, ktoré napodobní budúce rozhodovanie.

Ak dokážete tieto nedostatky pomenovať, rozumiete jadru učenia z dát. Model sa učí z toho, čo mu záznamy umožnia vidieť. Výpočtová schopnosť neodstraňuje chyby v otázke, meraní alebo hodnotení.

Zaznamenajte tiež, kto overil správnosť údajov a podľa akých pravidiel postupoval.

Pojmy v slovníku

učenie s učiteľom (supervised learning)

Rozšírené vysvetlenie v Premium: Kvalita dát a data governance. Ako kontrolovať kvalitu, pôvod a zodpovednosť za údaje pred analýzou. Táto nadväzujúca kapitola je za paywallom (Registrácia + Premium). Celý tento úvodný kurz zostáva zadarmo.

Zhrnutie kapitoly

Tréning hľadá použiteľné vzťahy v príkladoch. Výsledok treba hodnotiť aj na nových údajoch: zapamätanie tréningových príkladov ešte nie je schopnosť zovšeobecniť.

Praktické odpovede

Často kladené otázky

Čo je hlavná myšlienka kapitoly „Ako sa AI učí z dát“?

Tréning hľadá použiteľné vzťahy v príkladoch. Výsledok treba hodnotiť aj na nových údajoch: zapamätanie tréningových príkladov ešte nie je schopnosť zovšeobecniť.

Potrebujem na pochopenie programovanie?

Nie. Kapitola vysvetľuje princípy na modelových situáciách. Sledujte vstup, úlohu, výsledok a spôsob kontroly; matematické detaily nie sú podmienkou.

Ako si overím, že téme rozumiem?

Vyberte si iný príklad než v texte a vlastnými slovami vysvetlite postup. Pomenujte informácie, ktoré systém dostáva, jeho obmedzenia a človeka, ktorý skontroluje výsledok.

Dočítali ste lekciu.

Najlepšie porozumenie vzniká, keď si zhrniete tri hlavné myšlienky vlastnými slovami.