Model je iba jedna časť celého AI systému.
Strojové učenie je praktický spôsob, ako vytvoriť pravidlo z príkladov vtedy, keď by bolo ručné vypísanie všetkých podmienok príliš zložité alebo krehké.
Po prečítaní budete vedieť
- vysvetliť rozdiel medzi učením s učiteľom, bez učiteľa a posilňovaním
- rozlíšiť tréningovú, validačnú a testovaciu množinu
- identifikovať preučenie a únik informácií medzi dátami
- Strojové učenie vytvára modely, ktoré odhadujú alebo rozhodujú podľa vzorov získaných z dát.
- Úspešný projekt začína presnou otázkou a vhodnou metrikou, nie automatickým výberom najzložitejšieho algoritmu.
- Skutočnú kvalitu ukáže výkon na nových dátach, porovnanie s jednoduchým základom a posúdenie dôsledkov chýb.
Strojové učenie je prítomné vo filtrovaní spamu, odporúčaniach, odhadoch dopytu, kontrole kvality aj jazykových modeloch. Napriek širokému použitiu sa často opisuje buď príliš technicky, alebo tak neurčito, že „učenie“ pôsobí ako kúzlo. Základná myšlienka je pritom jednoduchá: z príkladov vytvoríme matematický model, ktorý dokáže užitočne pracovať s novým príkladom.
Model môže prideliť kategóriu, odhadnúť číslo, zoradiť možnosti alebo nájsť štruktúru. Jeho odpoveď nie je automaticky faktom. Je výsledkom vzťahu, ktorý algoritmus odhadol z dostupných dát podľa zvoleného cieľa. Ak sa zmenia dáta, cieľ alebo situácia, môže sa zmeniť aj správnosť výsledku.
Táto kapitola je praktickou mapou základných pojmov. Nepotrebuje programovanie ani zložité rovnice. Mechanizmus úpravy parametrov, samoučenie a učenie z odmeny podrobnejšie vysvetlila kapitola 4 - Ako sa AI učí. Tu sa sústredíme na to, ako rozpoznať typ problému, čo robia bežné algoritmy a ako zistiť, či model naozaj funguje.
Kde leží strojové učenie v AI
- Umelá inteligencia je širšia oblasť; strojové učenie je jeden z jej hlavných prístupov.
- Hlboké učenie je časť strojového učenia založená na viacvrstvových neurónových sieťach.
- Nie každý automatizovaný alebo pravidlový systém sa učí z dát.
Umelá inteligencia zahŕňa metódy na vnímanie, uvažovanie, plánovanie, rozhodovanie či tvorbu výstupov. Strojové učenie, machine learning, je podmnožina, pri ktorej sa správanie modelu odvodzuje zo skúsenosti reprezentovanej dátami. Hlboké učenie, deep learning, používa neurónové siete s mnohými vrstvami, ktoré sa dokážu učiť zložité reprezentácie obrazu, zvuku a jazyka.
Vzťah si možno predstaviť ako vnorené množiny: hlboké učenie patrí do strojového učenia a strojové učenie do širšej AI. Generatívna AI sa s týmto delením čiastočne prekrýva. Väčšina dnešných generatívnych modelov používa hlboké učenie, ale pojem generatívna opisuje účel - tvorbu nového obsahu - nie samostatnú úroveň hierarchie.
Mimo strojového učenia existujú expertné systémy s ručne vytvorenými pravidlami, vyhľadávacie a plánovacie algoritmy či optimalizačné metódy. V praxi sa prístupy kombinujú. Model odhadne pravdepodobnosť poruchy, pravidlo zakáže nebezpečnú akciu a optimalizátor zostaví harmonogram. Podrobné hranice AI rozoberá kapitola 2.
Nie každá úloha potrebuje ML. Ak sa pravidlo dá presne a stabilne zapísať - napríklad výpočet dane zo známych sadzieb - klasický program je transparentnejší a spoľahlivejší. Strojové učenie je vhodné najmä tam, kde je ťažké ručne opísať všetky pravidlá, no existuje dostatok relevantných príkladov a merateľný cieľ.
Najprv problém, až potom model
- Úlohu treba preložiť na jasný vstup, želaný výstup, používateľa a rozhodovací moment.
- Cieľová premenná musí skutočne zastupovať jav, ktorý chceme zlepšiť.
- Treba porovnať ML s pravidlom, procesnou zmenou aj možnosťou neurobiť žiadnu automatizáciu.
Nejasné zadanie „použime AI na zákazníkov“ nie je problém strojového učenia. Presnejšie zadanie môže znieť: z informácií dostupných v čase prijatia požiadavky odhadnúť, či bude potrebovať odbornú eskaláciu, aby sa správne zaradila. Vtedy poznáme jednotku predikcie, čas, vstupy, cieľ aj následnú akciu.
Zásadné je zabrániť použitiu informácie, ktorá v okamihu rozhodovania ešte nebude známa. Ak model pri tréningu dostane údaj vytvorený až po vybavení požiadavky, dosiahne výborné skóre, no v prevádzke ho nemožno použiť. Tento únik dát je častou príčinou klamlivých výsledkov.
Ďalším problémom je zástupný cieľ. Firma chce spokojnosť, ale optimalizuje kliknutie. Nemocnica chce lepší zdravotný výsledok, ale predpovedá historické rozhodnutie prijať pacienta. Škola chce porozumenie, ale meria iba dokončenie videa. Ľahko dostupná premenná nemusí reprezentovať skutočný účel a môže podporiť nežiaduce správanie.
Pred tréningom sa preto stanoví aj akcia po predikcii. Kto výsledok uvidí? Je to odporúčanie alebo automatické rozhodnutie? Čo urobí človek pri nízkej istote? Ak model nič nemení v procese, jeho presnosť nevytvára hodnotu. Ak mení veľa, rastie potreba kontroly, dokumentácie a možnosti odvolania.
Slovník jedného príkladu
- Príklad je jedno pozorovanie; príznaky opisujú jeho vstupné vlastnosti a štítok požadovaný výstup.
- Parametre sa učia z dát, hyperparametre nastavujú architektúru alebo tréning.
- Model je naučená funkcia, ktorá mapuje vstup na odhad, skóre alebo reprezentáciu.
Predstavme si tabuľku, v ktorej každý riadok predstavuje jednu objednávku. Riadok je príklad alebo pozorovanie. Stĺpce dostupné pred odoslaním - typ tovaru, spôsob dopravy, vzdialenosť či deň v týždni - sú príznaky, features. Informácia, či zásielka meškala, je štítok alebo cieľová premenná.
Príznak nemusí byť číslo. Kategóriu možno zakódovať, text previesť na vektor a obraz na pole hodnôt pixelov. Dobrý príznak je v čase použitia dostupný, spoľahlivo meraný a relevantný. Identifikátor zákazníka môže modelu umožniť zapamätať si osoby bez toho, aby sa naučil prenositeľný vzor; citlivý údaj môže priniesť diskriminačné alebo právne riziko.
Parametre sú hodnoty, ktoré algoritmus odhadne z tréningových dát. Pri priamke ide o sklon a posun, pri neurónovej sieti o veľké množstvo váh. Hyperparametre určuje vývojový proces: napríklad hĺbku stromu, silu regularizácie alebo rýchlosť učenia. Vyberajú sa pomocou validačných dát, nie podľa konečného testu.
Po tréningu vznikne model. Novému riadku pridelí napríklad pravdepodobnosť oneskorenia 0,72. Aplikácia môže podľa prahu 0,60 objednávku označiť na preventívnu kontrolu. Model poskytol skóre; konkrétne rozhodnutie vzniklo až spojením skóre s prahom a procesným pravidlom.
Klasifikácia: výber kategórie
- Klasifikácia predpovedá jednu alebo viac diskrétnych tried.
- Model často vytvára skóre či pravdepodobnosť a aplikácia z nich pomocou prahu urobí rozhodnutie.
- Kvalitu nemožno hodnotiť iba percentom správnych odpovedí, najmä pri nevyvážených triedach.
Pri binárnej klasifikácii sú dve triedy: spam alebo nie spam, porucha alebo bez poruchy. Viac-triedna klasifikácia vyberá jednu z viacerých možností, napríklad druh dokumentu. Pri multi-label úlohe môže príklad patriť do viacerých kategórií súčasne - fotografia obsahuje človeka, bicykel aj cestu.
Výstupom býva skóre. Prah určuje kompromis medzi zachytením pozitívnych prípadov a falošnými poplachmi. Ak znížime prah detekcie choroby, zachytíme viac skutočných pacientov, ale pošleme aj viac zdravých ľudí na doplňujúce vyšetrenie. Správny prah preto nevychádza iba z algoritmu; závisí od nákladov, kapacity a rizika.
Pri nevyvážených dátach môže byť samotná presnosť, accuracy, zavádzajúca. Ak je podvodom jedna transakcia z tisíca, model označujúci všetky ako bežné má presnosť 99,9 percenta a nulovú užitočnosť pri podvode. Potrebujeme rozlíšiť, ktoré druhy správnych a nesprávnych výsledkov model vytvára. K metrikám sa vrátime nižšie.
Klasifikácia tiež neobjavuje prirodzené, večné kategórie. Triedy definujú ľudia podľa účelu a údajov. Hranica medzi „prioritnou“ a „bežnou“ požiadavkou je organizačné pravidlo. Model ju reprodukuje alebo približuje; nerozhoduje, či je kategória morálne či vecne správna.
Regresia, poradie a odhad rizika
- Regresia predpovedá spojitú číselnú hodnotu, napríklad cenu, čas alebo spotrebu.
- Ranking zoraďuje možnosti podľa relevancie; odporúčanie nemusí predpovedať jednu správnu odpoveď.
- Odhad pravdepodobnosti treba odlíšiť od istoty a overiť jeho kalibráciu.
Regresia odpovedá číslom. Model môže odhadnúť zajtrajšiu spotrebu energie, čas doručenia alebo dopyt. Chyba 10 jednotiek však nemá všade rovnaký význam: pri lacnej položke môže byť veľká, pri drahej zanedbateľná. Hodnotenie sa preto prispôsobuje mierke a rozhodnutiu, ktoré odhad podporuje.
Ranking zoraďuje položky. Vyhľadávač zoradí dokumenty podľa odhadovanej relevancie, e-shop produkty podľa pravdepodobnosti záujmu a systém podpory požiadavky podľa priority. Zvyčajne neexistuje jediná univerzálne správna postupnosť. Relevantnosť závisí od dopytu, používateľa, času a cieľov prevádzkovateľa.
Model môže vytvárať rizikové skóre, napríklad pravdepodobnosť poruchy do tridsiatich dní. Ak zo sto prípadov so skóre 0,7 približne sedemdesiat skutočne nastane, model je v tejto oblasti dobre kalibrovaný. Model môže správne zoradiť rizikovejšie prípady, ale pravdepodobnosti systematicky nadhodnocovať. Diskriminácia a kalibrácia sú rozdielne vlastnosti.
Predikcia nie je osud. Skóre 70 percent nehovorí, že konkrétna udalosť „na 70 percent nastala“, ani neurčuje príčinu. Je to odhad pre podmienky podobné dátam, na ktorých bol model overený. Intervencie môžu výsledok zmeniť: preventívna údržba práve preto zabráni predpovedanej poruche.
Zhlukovanie, redukcia rozmerov a anomálie
- Neoznačené dáta možno organizovať podľa podobnosti bez vopred známych cieľových tried.
- Zhluky a vizualizácie sú závislé od reprezentácie a nastavenia algoritmu.
- Anomália znamená neobvyklosť, nie automaticky chybu, hrozbu alebo podvod.
Pri zhlukovaní sa podobné príklady spájajú do skupín. Algoritmus môže segmentovať vzory používania produktu, zoskupiť dokumenty podľa tém alebo pomôcť preskúmať biologické merania. Výsledok môže odhaliť užitočnú štruktúru, ale počet a význam skupín nie sú dané prírodou. Zmenou príznakov alebo miery vzdialenosti získame iný pohľad.
Pri stovkách premenných sa používa redukcia rozmerov. Vytvorí menšiu reprezentáciu, ktorá zachováva vybranú časť informácie. Dve dimenzie možno zobraziť v grafe, no vzdialenosti vo vizualizácii nemusia dokonale zodpovedať pôvodným dátam. Pekne oddelené farebné ostrovy nie sú samy osebe dôkazom reálnych sociálnych či biologických kategórií.
Detekcia anomálií sa učí, čo je bežné, a označí odchýlku. Hodí sa pri senzoroch, kybernetickej bezpečnosti alebo finančných tokoch, kde sú nebezpečné prípady zriedkavé a menia sa. Výstup má často slúžiť na triedenie práce analytika. Automatická sankcia založená iba na nezvyčajnosti by trestala aj legitímne nové správanie.
Tieto úlohy patria prevažne k učeniu bez učiteľa. Rozdiel medzi učením s učiteľom, samoučením a učením posilňovaním je rozobratý v kapitole 4. V praxi sa metódy spájajú: neoznačené dáta vytvoria reprezentáciu a menšia označená vzorka naučí konečný klasifikátor.
Lineárne a logistické modely
- Lineárny model skladá vážené príspevky príznakov do číselného odhadu.
- Logistická regresia používa podobný princíp na odhad pravdepodobnosti triedy.
- Jednoduché modely sú rýchle a vysvetliteľné, no bez úprav nezachytia zložité nelineárne vzťahy.
Lineárna regresia predpokladá, že predikciu možno vytvoriť sčítaním vážených príznakov a konštanty. Ak sa vzdialenosť zvýši o jednotku, odhad času sa pri ostatných rovnakých vlastnostiach zmení o určitú hodnotu. Koeficienty dávajú zrozumiteľný prvý obraz o tom, ako model používa vstupy.
Logistická regresia napriek názvu rieši klasifikáciu. Vážený súčet prevedie na hodnotu medzi nulou a jednotkou a odhaduje pravdepodobnosť triedy. Je silným základným modelom pre text, rizikové skóre aj medicínske údaje. Jej jednoduchosť pomáha pri audite a rýchlom pretrénovaní.
Koeficient však automaticky nedokazuje príčinu. Korelované príznaky si môžu príspevok rozdeliť nestabilne a výsledok závisí od škálovania či kódovania. Nelineárny vzťah možno pridať transformáciou alebo interakciou, ale pri veľkej zložitosti sa stráca pôvodná prehľadnosť.
Jednoduchý model nie je iba školská ukážka. Často je vhodným baseline, voči ktorému musí zložitejší systém preukázať pridanú hodnotu. Ak neurónová sieť zlepší metriku zanedbateľne, no je drahšia a horšie vysvetliteľná, lineárny model môže byť lepším riešením.
Rozhodovacie stromy a ich kolektívy
- Rozhodovací strom rozdeľuje dáta sériou otázok o príznakoch.
- Náhodný les priemeruje mnoho odlišných stromov a zvyšuje stabilitu.
- Gradientné posilňovanie stavia stromy postupne tak, aby opravovali chyby predchádzajúceho modelu.
Rozhodovací strom sa podobá postupnému dotazníku: je hodnota väčšia než prah, patrí kategória do skupiny, chýba údaj? Každé rozdelenie vedie do ďalšej vetvy a list vytvorí predikciu. Strom prirodzene zachytí nelineárne vzťahy a interakcie, pričom nevyžaduje rovnaké škálovanie všetkých príznakov.
Hlboký strom sa však ľahko preučí. Rozdelí dáta podľa náhodných detailov a vytvorí listy s malým počtom príkladov. Obmedzuje sa preto hĺbka, minimálna veľkosť listu alebo iný ukazovateľ zložitosti. Jeden menší strom sa dá čítať, ale jeho hranice môžu byť nestabilné.
Náhodný les, predstavený Leom Breimanom v práci Random Forests, trénuje mnoho stromov na obmenených vzorkách a náhodných podmnožinách príznakov. Ich hlasovanie alebo priemer znižuje citlivosť na jeden dataset. Cena za vyššiu presnosť je slabšia prehľadnosť než pri jedinom strome.
Gradient boosting buduje malé stromy postupne; každý ďalší sa zameria na chyby doterajšieho súboru. Implementácie ako XGBoost sú veľmi účinné pri tabuľkových dátach. Potrebujú však dôkladné ladenie a testovanie, pretože výkonný model sa tiež môže prispôsobiť šumu alebo uniknutým informáciám.
Najbližší susedia a podporné vektory
- Metóda najbližších susedov predpovedá podľa podobných príkladov uložených v dátach.
- Stroje s podpornými vektormi hľadajú hranicu s čo najväčším odstupom medzi triedami.
- Obe metódy závisia od vhodnej reprezentácie a mierky príznakov.
Algoritmus k najbližších susedov, k-nearest neighbors, si možno predstaviť bez tréningu zložitej rovnice. Pri novom príklade nájde k najpodobnejších známych príkladov a použije ich väčšinovú triedu alebo priemernú hodnotu. Je intuitívny a vie zachytiť nepravidelnú hranicu. Pri veľkých dátach môže byť predikcia pomalá a výsledok citlivý na irelevantné rozmery.
Kľúčové je, čo znamená „blízko“. Rozdiel jedného eura a jedného kilometra nemožno porovnávať bez škálovania. Pri texte či obraze sa podobnosť počíta v naučenej alebo skonštruovanej reprezentácii. Ak táto reprezentácia nezachytáva podstatný význam, susedia nebudú prakticky podobní.
Stroj s podpornými vektormi, SVM, hľadá rozhodovaciu hranicu s veľkým odstupom od najbližších príkladov jednotlivých tried. Pomocou jadier môže reprezentovať aj nelineárne hranice. Pôvodný rámec Cortesa a Vapnika je opísaný v práci Support-vector networks. SVM býva účinný pri menších a stredných datasetoch s veľkým počtom príznakov.
Tieto metódy ukazujú, že strojové učenie nie je synonymom neurónovej siete. Pre správne pripravené dáta môže tradičný algoritmus dosiahnuť výborný výsledok s menšími nákladmi. Výber má vychádzať z experimentu, veľkosti dát, času odozvy a potreby vysvetlenia.
Čítajte mapu od východiska cez súvislosť až po dôsledok. Spoločným jadrom je „Od problému po monitorovanie“.
Neurónové siete a hlboké učenie
- Neurónová sieť skladá vrstvy matematických transformácií a učí sa ich váhy.
- Hlboké siete sa dokážu naučiť reprezentácie priamo z obrazu, zvuku či textu.
- Vysoká flexibilita vyžaduje veľa dát, výpočtov a dôkladné hodnotenie.
Umelý neurón vytvorí vážený súčet vstupov, pridá posun a použije nelineárnu aktivačnú funkciu. Vrstva mnohých jednotiek vytvorí novú reprezentáciu; ďalšie vrstvy ju postupne transformujú. Sieť sa trénuje spätným šírením chyby a optimalizáciou, ktoré vysvetľuje kapitola 4.
Pri obraze sa skoršie vrstvy môžu naučiť lokálne hrany a textúry, neskoršie ich skladajú do zložitejších reprezentácií. Pri jazyku moderné transformery modelujú vzťahy medzi tokenmi v kontexte. Vývojár nemusí ručne vytvárať slovník každého vizuálneho či jazykového pravidla. Táto schopnosť reprezentácie je jadrom úspechu hlbokého učenia, ktorý zhrnuli LeCun, Bengio a Hinton v prehľade Deep learning.
Flexibilita má cenu. Sieť môže mať milióny až miliardy parametrov, potrebuje akcelerovaný hardvér a jej vnútorné rozhodovanie sa ťažšie vysvetľuje. Výkon závisí od veľkého množstva tréningových rozhodnutí. Model môže nájsť nečakanú skratku alebo byť citlivý na vstup, ktorý človek považuje za nevýznamný.
Hlboké učenie je mimoriadne vhodné pre neštruktúrované dáta a rozsiahle predtrénovanie. Pri malej tabuľke s niekoľkými premennými však nemusí prekonať boosting či lineárny model. „Najmodernejší“ algoritmus je moderný iba vzhľadom na problém, nie podľa názvu.
Od surových údajov k modelovému vstupu
- Dáta treba skontrolovať, vyčistiť, reprezentovať a transformovať bez úniku informácií z testu.
- Chýbajúce hodnoty, kategórie a rozdielne mierky vyžadujú explicitné rozhodnutia.
- Rovnaké transformačné kroky sa musia spoľahlivo použiť pri tréningu aj v prevádzke.
Reálny dataset obsahuje duplicity, chyby merania, rozdielne formáty a chýbajúce hodnoty. Čistenie nie je mechanické odstraňovanie „zlých riadkov“. Chýbajúca hodnota môže niesť informáciu - napríklad meranie chýba systematicky pri určitom type prípadu. Pred doplnením priemeru treba pochopiť proces vzniku dát.
Numerické príznaky sa pri niektorých algoritmoch štandardizujú, aby mali porovnateľnú mierku. Kategórie sa zakódujú, text tokenizuje alebo prevedie na vektory. Dátum možno rozložiť na deň týždňa a sezónu. Každá transformácia vnáša predpoklad o tom, ktoré rozdiely sú dôležité.
Transformácia sa musí naučiť iba na tréningovej sade. Ak priemer na škálovanie vypočítame zo všetkých dát vrátane testu, model získal malý náhľad do budúcnosti. Pri výbere príznakov je únik ešte závažnejší. Knižnica scikit-learn preto v návode upozorňuje na nekonzistentné predspracovanie a únik dát a odporúča spájať kroky do pipeline.
Pipeline zabezpečí, že imputácia, kódovanie a model sa vykonajú v rovnakom poradí pri tréningu aj inferencii. V produkcii treba navyše kontrolovať schému: či stĺpec nezmizol, jednotka sa nezmenila alebo sa neobjavila nová kategória. Model nepozná zámer dátového tímu; spracuje čísla, ktoré dostane.
Tréningová, validačná a testovacia sada
- Tréningová sada učí parametre, validačná vyberá variant a testovacia poskytuje posledný nezávislý odhad.
- Rozdelenie má napodobňovať budúce použitie a zabrániť prenosu informácie medzi sadami.
- Pri malých dátach pomáha krížové overovanie, ale nenahrádza reprezentatívny konečný test.
Náhodné rozdelenie je vhodné, ak sú príklady nezávislé a budúcnosť pochádza z rovnakého rozdelenia. Pri časovej predikcii sa však trénuje na minulosti a testuje na neskoršom období. Pri zdravotných záznamoch majú všetky návštevy jedného pacienta zostať v tej istej sade. Inak model spozná konkrétneho človeka namiesto prenositeľného vzoru.
Validačné dáta sa používajú opakovane: vyberáme algoritmus, príznaky, hyperparametre a prah. Každým rozhodnutím sa na ne nepriamo prispôsobujeme. Test sa preto otvorí až po uzavretí návrhu. Ak výsledok sklamal a cyklus zopakujeme, potrebujeme neskôr nový nezávislý test.
Pri krížovom overovaní rozdelíme tréningové dáta na viac častí. Model sa opakovane učí na väčšine a validuje na zostávajúcej časti. Získame distribúciu výsledkov a efektívnejšie využijeme menší dataset. Aj tu musíme rešpektovať čas, skupiny a celú pipeline predspracovania.
Jedno číslo bez intervalu môže skrývať náhodu. Výkon sa uvádza s variabilitou medzi deleniami alebo s intervalom spoľahlivosti, najmä pri vzácnych prípadoch. Sto percent na desiatich pozitívnych príkladoch je slabší dôkaz než 95 percent na tisícoch rôznorodých prípadov.
Matica zámen a klasifikačné metriky
- Matica zámen rozlišuje správne pozitívne, falošne pozitívne, správne negatívne a falošne negatívne výsledky.
- Precision odpovedá, koľko označených pozitívnych prípadov bolo správnych; recall, koľko skutočných pozitív model našiel.
- Výber metriky a prahu závisí od dôsledkov jednotlivých chýb.
Pri binárnej klasifikácii vznikajú štyri výsledky. True positive je správne zachytený pozitívny prípad, false positive falošný poplach. True negative je správne odmietnutý negatívny prípad a false negative prehliadnutý pozitívny. Ich počty tvorí matica zámen.
Precision, pozitívna prediktívna hodnota, je podiel skutočne pozitívnych medzi všetkými prípadmi označenými modelom. Je dôležitá, keď je preverenie poplachu drahé alebo keď falošné obvinenie škodí. Recall, citlivosť, je podiel zachytených medzi všetkými skutočne pozitívnymi. Je dôležitý, keď je prehliadnutie prípadu nebezpečné.
F1 skóre je harmonický priemer precision a recall a používa sa, keď chceme jednu vyváženú hodnotu. Stále však predpokladá určitý kompromis a ignoruje správne negatívne výsledky. Špecificita meria podiel správne rozpoznaných negatívnych prípadov. Dokumentácia metrík scikit-learn ukazuje, že vhodný výber závisí od typu úlohy a výstupu.
Krivky ROC a precision-recall porovnávajú správanie pri rôznych prahoch. Pri veľmi vzácnej pozitívnej triede býva precision-recall informatívnejšia. Ani plocha pod krivkou neurčí prevádzkový prah. Ten sa volí podľa nákladov omylu, dostupnej kapacity a pravidiel domény a potom overí na nezávislých dátach.
Ako merať číselnú predikciu
- MAE priemeruje absolútne chyby a zostáva v jednotke cieľa.
- RMSE viac zvýrazňuje veľké chyby, pretože rozdiely pred priemerovaním umocňuje.
- Priemer treba doplniť distribúciou chýb, porovnaním segmentov a praktickou toleranciou.
Priemerná absolútna chyba, MAE, vezme absolútny rozdiel medzi odhadom a skutočnosťou pri každom príklade a vypočíta priemer. MAE päť minút sa ľahko interpretuje. Každá ďalšia jednotka chyby má rovnakú váhu.
Koreň priemernej štvorcovej chyby, RMSE, veľké odchýlky trestá výraznejšie. Je vhodný, ak je jedna extrémna chyba podstatne horšia než viac menších. Zároveň je citlivý na odľahlé hodnoty. Voľba medzi metrikami je tvrdením o tom, aké chyby považujeme za dôležité.
Pri percentuálnej chybe vznikajú problémy okolo nuly a pri rozdielnych mierkach. Koeficient R² opisuje, koľko variability model vysvetľuje vzhľadom na jednoduchý priemer, no sám nehovorí, či je chyba prijateľná. V praxi sa preto ukáže aj medián, percentily, najhoršie prípady a výkon v relevantných skupinách.
Model treba porovnať s naivným základom: zajtrajšok sa rovná dnešku, čas je historický medián, všetky prípady dostanú priemer. Zložitý model s MAE 4,9 nie je úspech, ak jednoduché pravidlo dosiahne 5,0 a je lacnejšie, stabilnejšie a vysvetliteľnejšie.
Preučenie, regularizácia a kompromis zložitosti
- Príliš jednoduchý model podučí vzor; príliš flexibilný sa môže naučiť šum tréningovej vzorky.
- Regularizácia obmedzuje zložitosť alebo veľkosť parametrov a podporuje zovšeobecnenie.
- Konečným kritériom je stabilný výkon na nových a reprezentatívnych prípadoch.
Tréningová chyba s rastúcou flexibilitou zvyčajne klesá. To však nie je cieľ sám osebe. Model, ktorý si zapamätá každý bod, môže medzi nimi vytvoriť nezmyselnú hranicu. Preučenie spoznáme podľa veľkého rozdielu medzi tréningovým a validačným výsledkom. Podučenie má slabý výkon na oboch.
Regularizácia pridá preferenciu jednoduchšieho riešenia. Pri lineárnom modeli trestá veľké koeficienty, pri strome obmedzí hĺbku, pri neurónovej sieti možno náhodne vypínať jednotky alebo zastaviť tréning pred zhoršením validácie. Dátová augmentácia pridáva realistické obmeny príkladov.
Jednoduchosť neznamená čo najmenej parametrov za každú cenu. Moderný veľký model môže vďaka predtrénovaniu dobre zovšeobecňovať, hoci je parametricky obrovský. Relevantná zložitosť závisí od dát, úlohy a spôsobu učenia. Praktický výber sa opiera o nezávislé výsledky, nie o jednu všeobecnú poučku.
Po nasadení sa môže zmeniť rozdelenie dát. Aj model, ktorý pôvodne zovšeobecňoval dobre, začne zlyhávať. Monitorovanie, spätná väzba a kontrolované aktualizácie sú preto súčasťou riešenia; životný cyklus podrobne rozoberie kapitola 10 - Ako vznikajú AI modely.
Vysvetliteľnosť, dôležitosť príznakov a príčina
- Vysvetlenie môže opisovať globálne správanie modelu alebo dôvody jednej konkrétnej predikcie.
- Dôležitosť príznaku ukazuje využitie pre predikciu, nie morálnu oprávnenosť ani príčinný účinok.
- Čím závažnejšie rozhodnutie, tým viac treba vysvetlenie spojiť s validáciou a procesnou zodpovednosťou.
Pri malom strome možno sledovať cestu vetvami a pri lineárnom modeli koeficienty. Pri komplexnom modeli sa používajú dodatočné metódy: zmena výstupu po permutácii príznaku, lokálna aproximácia alebo rozdelenie príspevkov medzi vstupy. Každá vysvetľuje určitý aspekt a má vlastné predpoklady.
Globálne vysvetlenie opisuje typické správanie v datasete. Lokálne vysvetlenie sa týka konkrétneho prípadu. Ak príznak celkovo dôležitý nebol, v jednej predikcii môže mať veľký vplyv a naopak. Používateľ potrebuje vedieť, či vysvetlenie opisuje model, dáta alebo skutočný svet.
Model odhaľuje prediktívne asociácie. Ak používanie určitej služby súvisí s odchodom zákazníkov, neznamená to, že služba odchod spôsobuje. Možno ju využívajú už nespokojní zákazníci. Na otázku „čo sa stane, ak zasiahneme?“ sú potrebné kauzálne metódy, experiment alebo dôveryhodné doménové predpoklady.
Vysvetliteľnosť sama neospravedlní nespravodlivý cieľ či nekvalitné dáta. Transparentný model môže systematicky diskriminovať a neprehľadný model môže mať výborný výkon; obe vlastnosti treba posudzovať samostatne. NIST upozorňuje, že škodlivé skreslenie môže vzniknúť v dátach, technickom návrhu aj spoločenskom kontexte v správe Towards a Standard for Identifying and Managing Bias in AI.
Kedy strojové učenie radšej nepoužiť
- ML nie je vhodné bez dostatočných relevantných dát, merateľného cieľa alebo možnosti bezpečne pracovať s chybou.
- Presné a stabilné pravidlo môže byť lacnejšie, auditovateľnejšie a spoľahlivejšie.
- Automatizácia nemá zakryť hodnotové rozhodnutie, ktoré musí urobiť zodpovedný človek alebo inštitúcia.
Ak máme málo príkladov a jav sa rýchlo mení, model sa nemá z čoho spoľahlivo učiť. Ak výsledok poznáme až po rokoch, spätná väzba je pomalá. Ak nevieme definovať, čo znamená úspech, algoritmus bude optimalizovať pohodlnú náhradu. Technická možnosť vytvoriť skóre ešte neznamená pripravenosť na nasadenie.
Pri nulovej tolerancii chyby môže byť vhodnejší formálne overený postup alebo pevné pravidlo. Strojové učenie je pravdepodobnostné a jeho správanie sa hodnotí empiricky. Môže pomáhať s triedením či návrhom, zatiaľ čo kritické obmedzenie zostane deterministické.
Niektoré rozhodnutia obsahujú spor o hodnoty: koho uprednostniť pri obmedzenom zdroji, aké kritériá sú spravodlivé, aké riziko je prijateľné. Model môže analyzovať scenáre, ale nemá legitímnu autoritu tento spor sám uzavrieť. Zodpovednosť nemožno preniesť na dataset.
Treba rátať aj s celkovými nákladmi: zber a ochrana dát, vývoj, integrácia, monitorovanie, riešenie sťažností a aktualizácie. Jednoduchá zmena formulára alebo školenie pracovníkov môže odstrániť príčinu problému účinnejšie než predikčný model.
Príklad od začiatku do konca: spamový filter
- Spamový filter ukazuje celý reťazec od definície cieľa cez dáta a reprezentáciu až po prah a spätnú väzbu.
- Falošne zablokovaný dôležitý e-mail a prepustený spam majú rozdielne náklady.
- Model sa musí prispôsobovať meniacim sa správam a zároveň odolávať spätnej väzbe útočníkov.
Najprv definujeme jednotku: jedna prichádzajúca správa. Vstupom je obsah, technické hlavičky a povolené kontextové znaky dostupné pri doručení. Cieľom je odhadnúť, či ide o nevyžiadanú alebo podvodnú správu. Ak používateľské označenia slúžia ako štítky, treba počítať s omylmi a rozdielnymi preferenciami.
Text sa prevedie na príznaky alebo reprezentáciu. Jednoduchý model môže používať výskyt slov a znakov; moderný model zachytí širší kontext. Pridanie adresy odosielateľa môže zlepšiť výkon, ale treba ošetriť nové a podvrhnuté adresy. Správy od rovnakého odosielateľa nesmú byť nevhodne rozdelené medzi tréning a test, ak chceme merať prenos.
Začneme pravidlom a logistickou regresiou ako základom, potom porovnáme zložitejší model. Testovacia sada obsahuje neskoršie obdobie, pretože útočníci menia taktiky. Sledujeme precision aj recall, no prah volíme s ohľadom na vysokú cenu zadržania legitímnej správy. Neisté prípady môžu skončiť v priečinku spam namiesto definitívneho vymazania.
Po nasadení sledujeme sťažnosti, obnovené správy, prepustené kampane a výkon v rôznych jazykoch. Útočník sa môže zámerne prispôsobovať filtru a otráviť spätnú väzbu, preto nové označenia nevstupujú do tréningu bez kontroly. Aktualizácia sa otestuje na stabilnej sade aj na čerstvých útokoch.
Príklad ukazuje, že algoritmus je iba jedna časť. Hodnotu vytvára správna definícia, kvalitný tok dát, vhodný prah, bezpečné používateľské rozhranie a monitorovanie. Rovnakú logiku možno preniesť na údržbu stroja, triedenie dokumentov či predikciu dopytu, hoci metriky a dôsledky budú iné.
Model je iba jedna časť celého AI systému. Náčrt použite ako krátku kontrolu pred praktickým rozhodnutím.
Záver: dobrý model je overený nástroj
- Strojové učenie premieňa príklady na model, ktorý má zovšeobecniť vzor na nové prípady.
- Algoritmus, metrika a prah sa vyberajú podľa problému a ceny chýb.
- Nasadenie je priebežný sociotechnický proces, nie koniec po dosiahnutí vysokého skóre.
Strojové učenie nemusí byť čiernou skrinkou už na úrovni základnej logiky. Máme príklady a príznaky, zvolíme úlohu a cieľ, model natrénujeme na jednej časti dát a nezávisle otestujeme na druhej. Klasifikácia vyberá triedu, regresia odhaduje číslo, ranking zoraďuje a učenie bez učiteľa hľadá štruktúru.
Rozličné algoritmy predstavujú rozličné predpoklady. Lineárny model skladá príspevky, strom kladie otázky, najbližší susedia používajú podobnosť a neurónová sieť sa učí viac vrstiev reprezentácie. Neexistuje víťaz pre všetky datasety. Rozumný projekt začína jednoduchým základom a zložitosť pridáva iba vtedy, keď preukázateľne pomáha.
Najdôležitejšie rozhodnutia často ležia mimo kódu: čo označíme za úspech, koho dáta chýbajú, ktorá chyba je závažnejšia a kto smie podľa skóre konať. Preto sa výkon dopĺňa o bezpečnosť, férovosť, vysvetliteľnosť, náklady a monitorovanie. V kapitole 9 tieto podmienky použijeme na určenie vhodných a nevhodných oblastí AI; v kapitole 10 prejdeme celý produkčný životný cyklus.
Hĺbkové vysvetlenie a pedagogický seminár
Táto časť rozširuje tému strojové učenie jednoducho od základného porozumenia k samostatnej práci. Cieľom nie je zapamätať si čo najviac výrazov. Cieľ je porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Čitateľ má po prejdení výkladu vedieť pojem opísať vlastnými slovami, rozpoznať ho v novom prípade, oddeliť fakt od predpokladu a navrhnúť primeraný ďalší krok.
Pracujte aktívne. Po každom bloku zatvorte text a skúste myšlienku vysvetliť bez pomoci. Potom ju použite na inom príklade, než je uvedený v kapitole. Ak vysvetlenie funguje iba pri pôvodnej formulácii, ešte nejde o prenositeľné poznanie. Praktickým výsledkom tejto časti bude jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou.
Pri každej úlohe sa oddeľuje odborná presnosť od jazykovej presvedčivosti. Dobrá odpoveď musí ukázať pôvod tvrdenia, podmienky platnosti a neistotu. Základné dôkazové pravidlo je: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Súčasne platí hranica: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo.
Pojmová mapa do hĺbky
1. Učenie s učiteľom
model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte učenie s učiteľom vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
2. Učenie bez učiteľa
algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte učenie bez učiteľa vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
3. Samoučenie z dát
systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte samoučenie z dát vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
4. Posilňované učenie
agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte posilňované učenie vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
5. Príznak a reprezentácia
príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte príznak a reprezentácia vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
6. Baseline
jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte baseline vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
7. Metrika a prah
priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte metrika a prah vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
8. Produkčná spätná väzba
monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Tento pojem preto netreba poznať iba ako definíciu. Čitateľ má vedieť vysvetliť, akú úlohu plní, s čím sa dá zameniť a podľa akého pozorovateľného znaku ho rozpozná v reálnom systéme. Pri učení pomáha nakresliť si jednoduchú schému: vstup, spracovanie, výstup, kontrola a následok chyby. Pojem sa tak prestane javiť ako izolované cudzie slovo a dostane miesto v celom procese.
V tejto kapitole posudzujte produkčná spätná väzba vo vzťahu k cieľu: porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby Nestačí povedať, že prvok je dôležitý. Treba ukázať mechanizmus, konkrétny príklad a hranicu platnosti. Ak dve vysvetlenia vedú k odlišným praktickým rozhodnutiam, porovnajte ich na rovnakom vstupe a zapíšte, ktorý rozdiel výsledok spôsobil.
Pracovná otázka: Ako by ste tento pojem vysvetlili človeku, ktorý nepozná odbornú terminológiu, ale musí podľa vysvetlenia urobiť správne rozhodnutie? Odpoveď má obsahovať bežný príklad, jeden nepríklad a vetu o tom, čo z pojmu nemožno vyvodiť. Overenie sa riadi pravidlom: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb.
Ako sa pojmy ovplyvňujú
Samostatná znalosť definícií nestačí, pretože systémy AI vznikajú spojením viacerých vrstiev. Nasledujúce dvojice ukazujú, kde býva medzi pojmami príčinná väzba, kde ide o obmedzenie a kde iba o zdanlivú podobnosť. Pri každej väzbe si položte otázku, čo by zostalo rovnaké, keby sa zmenil iba jeden z dvoch prvkov.
Väzba 1: Učenie s učiteľom a Učenie bez učiteľa
Pojmy učenie s učiteľom a učenie bez učiteľa sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Druhý dopĺňa odlišnú časť obrazu: algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Väzba 2: Učenie bez učiteľa a Samoučenie z dát
Pojmy učenie bez učiteľa a samoučenie z dát sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Druhý dopĺňa odlišnú časť obrazu: systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Väzba 3: Samoučenie z dát a Posilňované učenie
Pojmy samoučenie z dát a posilňované učenie sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Druhý dopĺňa odlišnú časť obrazu: agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Väzba 4: Posilňované učenie a Príznak a reprezentácia
Pojmy posilňované učenie a príznak a reprezentácia sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Druhý dopĺňa odlišnú časť obrazu: príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Väzba 5: Príznak a reprezentácia a Baseline
Pojmy príznak a reprezentácia a baseline sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Druhý dopĺňa odlišnú časť obrazu: jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Väzba 6: Baseline a Metrika a prah
Pojmy baseline a metrika a prah sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Druhý dopĺňa odlišnú časť obrazu: priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Väzba 7: Metrika a prah a Produkčná spätná väzba
Pojmy metrika a prah a produkčná spätná väzba sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Druhý dopĺňa odlišnú časť obrazu: monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Väzba 8: Produkčná spätná väzba a Učenie s učiteľom
Pojmy produkčná spätná väzba a učenie s učiteľom sa v praxi stretávajú, ale neznamenajú to isté. Prvý opisuje túto skutočnosť: monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Druhý dopĺňa odlišnú časť obrazu: model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Rozlíšenie je dôležité preto, že zmena jednej časti nemusí automaticky zmeniť druhú. Lepší či väčší vstup napríklad nemusí odstrániť chybný cieľ, rovnako ako kvalitný postup nemusí napraviť neoverený zdroj.
Vytvorte dve krátke tvrdenia. V prvom použite oba pojmy správne a ukážte medzi nimi príčinnú alebo procesnú väzbu. V druhom zámerne urobte bežnú zámenu. Potom vysvetlite, čo by sa pri tejto zámene pokazilo v artefakte jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Takéto porovnanie je náročnejšie než zopakovanie definície, ale spoľahlivejšie odhalí skutočné porozumenie.
Kontrolný bod: Hranica tejto úvahy znie: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak príklad hranicu prekračuje, treba ho označiť ako hypotézu alebo úlohu pre odborníka, nie ako hotový záver.
Rozpracované prípady z praxe
Prípadová štúdia nemá jedinú správnu vetu. Má však správny spôsob práce: pomenovať otázku, preveriť vstupy, použiť vhodné pojmy, ukázať neistotu a vybrať krok primeraný následkom chyby. Nasledujúce prípady sú zámerne zostavené tak, aby nestačilo iba zopakovať poučku.
Prípad 1: Predikcia odchodu zákazníka
Situácia: firma má historické dáta, ale zásah obchodného tímu mení správanie a komplikuje interpretáciu úspešnosti. Najskôr oddeľte to, čo o prípade naozaj vieme, od predpokladov a dojmov. Vytvorte tri stĺpce: doložené fakty, pracovné hypotézy a chýbajúce údaje. Toto rozdelenie bráni tomu, aby plynulé vysvetlenie zakrylo nedostatok dôkazov.
Analýza: Prípad preskúmajte cez pojmy učenie s učiteľom a posilňované učenie. Pri prvom platí: model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Pri druhom platí: agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Napíšte, ktorý z nich vysvetľuje pozorovaný jav a ktorý iba pomáha určiť ďalšiu otázku. Ak ich nemožno rozlíšiť z dostupných údajov, správnym výsledkom je zoznam potrebných dôkazov, nie sebavedomý odhad.
Rozhodnutie: Navrhnite najmenší bezpečný ďalší krok. Má viesť k cieľu porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby a súčasne rešpektovať hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Výstupom nemá byť iba odsek textu, ale konkrétna položka použiteľná v praxi - rozhodovací záznam, porovnávacia tabuľka, test, kontrolný zoznam alebo opravený návrh.
Spätná kontrola: Iný človek má vedieť z výstupu určiť, z akých údajov vznikol a prečo bol zvolený daný krok. Platí dôkazové pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Ak táto stopa chýba, prípad ešte nie je uzavretý.
Prípad 2: Zoskupenie dokumentov
Situácia: tím chce objaviť témy bez ručných štítkov, no výsledné skupiny musí pomenovať a overiť doménový odborník. Najskôr oddeľte to, čo o prípade naozaj vieme, od predpokladov a dojmov. Vytvorte tri stĺpce: doložené fakty, pracovné hypotézy a chýbajúce údaje. Toto rozdelenie bráni tomu, aby plynulé vysvetlenie zakrylo nedostatok dôkazov.
Analýza: Prípad preskúmajte cez pojmy samoučenie z dát a baseline. Pri prvom platí: systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Pri druhom platí: jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Napíšte, ktorý z nich vysvetľuje pozorovaný jav a ktorý iba pomáha určiť ďalšiu otázku. Ak ich nemožno rozlíšiť z dostupných údajov, správnym výsledkom je zoznam potrebných dôkazov, nie sebavedomý odhad.
Rozhodnutie: Navrhnite najmenší bezpečný ďalší krok. Má viesť k cieľu porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby a súčasne rešpektovať hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Výstupom nemá byť iba odsek textu, ale konkrétna položka použiteľná v praxi - rozhodovací záznam, porovnávacia tabuľka, test, kontrolný zoznam alebo opravený návrh.
Spätná kontrola: Iný človek má vedieť z výstupu určiť, z akých údajov vznikol a prečo bol zvolený daný krok. Platí dôkazové pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Ak táto stopa chýba, prípad ešte nie je uzavretý.
Prípad 3: Detekcia podvodu
Situácia: podvody sú zriedkavé, chyby majú rozdielnu cenu a páchatelia sa prispôsobujú známym kontrolám. Najskôr oddeľte to, čo o prípade naozaj vieme, od predpokladov a dojmov. Vytvorte tri stĺpce: doložené fakty, pracovné hypotézy a chýbajúce údaje. Toto rozdelenie bráni tomu, aby plynulé vysvetlenie zakrylo nedostatok dôkazov.
Analýza: Prípad preskúmajte cez pojmy príznak a reprezentácia a produkčná spätná väzba. Pri prvom platí: príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Pri druhom platí: monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Napíšte, ktorý z nich vysvetľuje pozorovaný jav a ktorý iba pomáha určiť ďalšiu otázku. Ak ich nemožno rozlíšiť z dostupných údajov, správnym výsledkom je zoznam potrebných dôkazov, nie sebavedomý odhad.
Rozhodnutie: Navrhnite najmenší bezpečný ďalší krok. Má viesť k cieľu porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby a súčasne rešpektovať hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Výstupom nemá byť iba odsek textu, ale konkrétna položka použiteľná v praxi - rozhodovací záznam, porovnávacia tabuľka, test, kontrolný zoznam alebo opravený návrh.
Spätná kontrola: Iný človek má vedieť z výstupu určiť, z akých údajov vznikol a prečo bol zvolený daný krok. Platí dôkazové pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Ak táto stopa chýba, prípad ešte nie je uzavretý.
Prípad 4: Odporúčací systém
Situácia: kliknutie je ľahko merateľné, ale nemusí predstavovať spokojnosť, kvalitu ani dlhodobý záujem používateľa. Najskôr oddeľte to, čo o prípade naozaj vieme, od predpokladov a dojmov. Vytvorte tri stĺpce: doložené fakty, pracovné hypotézy a chýbajúce údaje. Toto rozdelenie bráni tomu, aby plynulé vysvetlenie zakrylo nedostatok dôkazov.
Analýza: Prípad preskúmajte cez pojmy metrika a prah a učenie bez učiteľa. Pri prvom platí: priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Pri druhom platí: algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Napíšte, ktorý z nich vysvetľuje pozorovaný jav a ktorý iba pomáha určiť ďalšiu otázku. Ak ich nemožno rozlíšiť z dostupných údajov, správnym výsledkom je zoznam potrebných dôkazov, nie sebavedomý odhad.
Rozhodnutie: Navrhnite najmenší bezpečný ďalší krok. Má viesť k cieľu porozumieť základným druhom strojového učenia a vedieť vybrať primeraný postup podľa dostupných dát, cieľa a ceny chyby a súčasne rešpektovať hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Výstupom nemá byť iba odsek textu, ale konkrétna položka použiteľná v praxi - rozhodovací záznam, porovnávacia tabuľka, test, kontrolný zoznam alebo opravený návrh.
Spätná kontrola: Iný človek má vedieť z výstupu určiť, z akých údajov vznikol a prečo bol zvolený daný krok. Platí dôkazové pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Ak táto stopa chýba, prípad ešte nie je uzavretý.
Hodnotiaca rubrika
Výstup hodnotite na piatich osiach od nula do štyri. Pri pojmovej presnosti znamená nula zámenu základných pojmov a štvorka správne vysvetlenie vrátane hranice a nepríkladu. Pri dôkazovej opore znamená nula tvrdenia bez pôvodu a štvorka jasné oddelenie zdroja, pozorovania, výpočtu a hypotézy. Pri praktickej použiteľnosti znamená nula všeobecnú radu a štvorka konkrétny artefakt s vlastníkom a ďalším krokom.
Štvrtou osou je riadenie rizika. Najvyššie hodnotenie dostane riešenie, ktoré pomenuje následok chyby, zvolí primeranú kontrolu a vie sa bezpečne zastaviť. Piatou osou je zrozumiteľnosť. Odbornosť sa neposudzuje podľa počtu cudzích slov, ale podľa toho, či text používa presné výrazy, vysvetľuje ich a vedie čitateľa od známeho k novému.
Za zvládnutú sa považuje odpoveď, ktorá má aspoň tri body na každej osi a spolu najmenej sedemnásť bodov z dvadsiatich. Slabšia os sa neopravuje kozmetickou úpravou. Pri nízkej presnosti sa treba vrátiť k definíciám, pri slabých dôkazoch k zdrojom, pri nízkej použiteľnosti k cieľu a pri riziku k hraniciam nasadenia.
Seminárne úlohy s postupom riešenia
Nasledujúce úlohy možno riešiť samostatne alebo v skupine. Každá spája pojem s konkrétnym prípadom a vyžaduje výstup, ktorý sa dá skontrolovať. Pri skupinovej práci nech jedna osoba pripraví riešenie, druhá ho skúsi vyvrátiť a tretia skontroluje zrozumiteľnosť pre človeka mimo odboru.
Seminárna úloha 1: Učenie s učiteľom v situácii zoskupenie dokumentov
Úlohu spracujte ako vysvetlenie pre začiatočníka. Východiskom je situácia: tím chce objaviť témy bez ručných štítkov, no výsledné skupiny musí pomenovať a overiť doménový odborník. Hlavný pojem má tento význam: model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem samoučenie z dát, ktorý pripomína: systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 2: Učenie bez učiteľa v situácii detekcia podvodu
Úlohu spracujte ako odborné posúdenie tvrdenia. Východiskom je situácia: podvody sú zriedkavé, chyby majú rozdielnu cenu a páchatelia sa prispôsobujú známym kontrolám. Hlavný pojem má tento význam: algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem baseline, ktorý pripomína: jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 3: Samoučenie z dát v situácii odporúčací systém
Úlohu spracujte ako návrh kontrolovaného pracovného postupu. Východiskom je situácia: kliknutie je ľahko merateľné, ale nemusí predstavovať spokojnosť, kvalitu ani dlhodobý záujem používateľa. Hlavný pojem má tento význam: systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem učenie s učiteľom, ktorý pripomína: model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 4: Posilňované učenie v situácii predikcia odchodu zákazníka
Úlohu spracujte ako diagnostika zlyhania. Východiskom je situácia: firma má historické dáta, ale zásah obchodného tímu mení správanie a komplikuje interpretáciu úspešnosti. Hlavný pojem má tento význam: agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem posilňované učenie, ktorý pripomína: agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 5: Príznak a reprezentácia v situácii zoskupenie dokumentov
Úlohu spracujte ako vysvetlenie pre začiatočníka. Východiskom je situácia: tím chce objaviť témy bez ručných štítkov, no výsledné skupiny musí pomenovať a overiť doménový odborník. Hlavný pojem má tento význam: príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem metrika a prah, ktorý pripomína: priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 6: Baseline v situácii detekcia podvodu
Úlohu spracujte ako odborné posúdenie tvrdenia. Východiskom je situácia: podvody sú zriedkavé, chyby majú rozdielnu cenu a páchatelia sa prispôsobujú známym kontrolám. Hlavný pojem má tento význam: jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem učenie bez učiteľa, ktorý pripomína: algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 7: Metrika a prah v situácii odporúčací systém
Úlohu spracujte ako návrh kontrolovaného pracovného postupu. Východiskom je situácia: kliknutie je ľahko merateľné, ale nemusí predstavovať spokojnosť, kvalitu ani dlhodobý záujem používateľa. Hlavný pojem má tento význam: priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem príznak a reprezentácia, ktorý pripomína: príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 8: Produkčná spätná väzba v situácii predikcia odchodu zákazníka
Úlohu spracujte ako diagnostika zlyhania. Východiskom je situácia: firma má historické dáta, ale zásah obchodného tímu mení správanie a komplikuje interpretáciu úspešnosti. Hlavný pojem má tento význam: monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem produkčná spätná väzba, ktorý pripomína: monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 9: Učenie s učiteľom v situácii zoskupenie dokumentov
Úlohu spracujte ako vysvetlenie pre začiatočníka. Východiskom je situácia: tím chce objaviť témy bez ručných štítkov, no výsledné skupiny musí pomenovať a overiť doménový odborník. Hlavný pojem má tento význam: model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem samoučenie z dát, ktorý pripomína: systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 10: Učenie bez učiteľa v situácii detekcia podvodu
Úlohu spracujte ako odborné posúdenie tvrdenia. Východiskom je situácia: podvody sú zriedkavé, chyby majú rozdielnu cenu a páchatelia sa prispôsobujú známym kontrolám. Hlavný pojem má tento význam: algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem baseline, ktorý pripomína: jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 11: Samoučenie z dát v situácii odporúčací systém
Úlohu spracujte ako návrh kontrolovaného pracovného postupu. Východiskom je situácia: kliknutie je ľahko merateľné, ale nemusí predstavovať spokojnosť, kvalitu ani dlhodobý záujem používateľa. Hlavný pojem má tento význam: systém vytvára učebný signál zo samotnej štruktúry dát, napríklad predikciou zakrytej alebo nasledujúcej časti. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem učenie s učiteľom, ktorý pripomína: model dostáva vstupy so známym cieľom a učí sa funkciu pre klasifikáciu alebo odhad číselnej hodnoty. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 12: Posilňované učenie v situácii predikcia odchodu zákazníka
Úlohu spracujte ako diagnostika zlyhania. Východiskom je situácia: firma má historické dáta, ale zásah obchodného tímu mení správanie a komplikuje interpretáciu úspešnosti. Hlavný pojem má tento význam: agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem posilňované učenie, ktorý pripomína: agent volí akcie, pozoruje odmenu a učí sa politiku, pričom zle navrhnutá odmena môže viesť k neželanému správaniu. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 13: Príznak a reprezentácia v situácii zoskupenie dokumentov
Úlohu spracujte ako vysvetlenie pre začiatočníka. Východiskom je situácia: tím chce objaviť témy bez ručných štítkov, no výsledné skupiny musí pomenovať a overiť doménový odborník. Hlavný pojem má tento význam: príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem metrika a prah, ktorý pripomína: priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 14: Baseline v situácii detekcia podvodu
Úlohu spracujte ako odborné posúdenie tvrdenia. Východiskom je situácia: podvody sú zriedkavé, chyby majú rozdielnu cenu a páchatelia sa prispôsobujú známym kontrolám. Hlavný pojem má tento význam: jednoduché pravidlo alebo existujúci postup určuje, či zložitejší model prináša merateľnú hodnotu. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem učenie bez učiteľa, ktorý pripomína: algoritmus hľadá štruktúru bez jednej správnej odpovede, napríklad zoskupenie, podobnosť alebo nezvyčajný prípad. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 15: Metrika a prah v situácii odporúčací systém
Úlohu spracujte ako návrh kontrolovaného pracovného postupu. Východiskom je situácia: kliknutie je ľahko merateľné, ale nemusí predstavovať spokojnosť, kvalitu ani dlhodobý záujem používateľa. Hlavný pojem má tento význam: priemer úspešnosti nestačí, ak majú falošné pozitívne a falošné negatívne výsledky odlišné následky. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem príznak a reprezentácia, ktorý pripomína: príznak je informácia použitá modelom, kým reprezentácia môže byť ručne navrhnutá alebo naučená z dát. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Seminárna úloha 16: Produkčná spätná väzba v situácii predikcia odchodu zákazníka
Úlohu spracujte ako diagnostika zlyhania. Východiskom je situácia: firma má historické dáta, ale zásah obchodného tímu mení správanie a komplikuje interpretáciu úspešnosti. Hlavný pojem má tento význam: monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Nezačínajte hotovým záverom. Najprv jednou vetou pomenujte otázku, ktorú riešite, potom vypíšte dostupné vstupy a označte údaj, ktorý by mohol najviac zmeniť výsledok.
Do riešenia zapojte aj pojem produkčná spätná väzba, ktorý pripomína: monitorovanie sleduje vstupy, výstupy, oneskorenie, ľudské opravy a zmeny prostredia po nasadení. Vysvetlite, či medzi pojmami vzniká príčinný vzťah, obmedzenie, kontrola alebo iba voľná súvislosť. Ak tvrdíte príčinu, uveďte aj alternatívne vysvetlenie. Ak navrhujete postup, určte vlastníka každého kroku a bod, v ktorom musí zasiahnuť človek.
Výsledok odovzdajte v podobe jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Musí obsahovať stručný záver, dôvody, neistoty, zdroje alebo vstupné údaje a jeden test, ktorým možno záver spochybniť. Nestačí, aby text pôsobil odborne. Hodnotí sa, či sa dá overiť a či podľa neho možno konať bez skrytých domnienok.
Sebahodnotenie: Overte presnosť pojmov, logickú nadväznosť a zrozumiteľnosť pre cieľového čitateľa. Použite pravidlo: model sa porovnáva s jednoduchým východiskovým riešením na reprezentatívnych dátach a hodnotí sa aj podľa následkov rôznych chýb. Nakoniec skontrolujte hranicu: strojové učenie nenahrádza jasnú definíciu problému a nemá zmysel tam, kde postačuje jednoduché, stabilné a vysvetliteľné pravidlo. Ak ju riešenie prekračuje, preformulujte záver na podmienené tvrdenie alebo odporúčanie na ďalšie odborné posúdenie.
Záverečné overenie porozumenia
Bez návratu k textu vysvetlite tri najdôležitejšie pojmy, ku každému uveďte príklad aj nepríklad a nakreslite medzi nimi väzby. Potom vyberte jeden prípad z vlastnej práce alebo života a spracujte ho podľa rovnakej štruktúry ako prípadové štúdie. Ak neviete určiť vstup, dôkaz a hranicu rozhodnutia, vráťte sa k príslušnému bloku.
Záverečný artefakt má mať podobu jednostránkový návrh ML úlohy s cieľovou premennou, dátovou jednotkou, baseline, metrikou, validačným plánom a prevádzkovou kontrolou. Mal by byť použiteľný aj o mesiac, keď už nebudete mať v pamäti formulácie tejto kapitoly. Doplňte preto dátum, zdroje, predpoklady, rozhodnutie, zodpovednú osobu a podmienku revízie. Tak sa učivo mení na pracovnú kompetenciu, nie iba na dočasný pocit porozumenia.
Zdroje a ďalšie čítanie
- Zdroje zahŕňajú otvorené učebnice, oficiálnu dokumentáciu a pôvodné práce k vybraným algoritmom.
- Kapitola vysvetľuje princípy; konkrétna implementácia musí rešpektovať doménu, verziu nástroja a aktuálne pravidlá.
- Zoznam a odkazy sú skontrolované k augustu 2026.
- Trevor Hastie, Robert Tibshirani, Jerome Friedman: The Elements of Statistical Learning, druhé vydanie, Springer, 2009.
- Ian Goodfellow, Yoshua Bengio, Aaron Courville: Deep Learning - Machine Learning Basics, MIT Press, 2016.
- scikit-learn: User Guide, aktuálna dokumentácia.
- scikit-learn: Metrics and scoring, aktuálna dokumentácia.
- scikit-learn: Common pitfalls and recommended practices, aktuálna dokumentácia.
- Leo Breiman: Random Forests, Machine Learning, 2001.
- Tianqi Chen, Carlos Guestrin: XGBoost: A Scalable Tree Boosting System, KDD, 2016.
- Corinna Cortes, Vladimir Vapnik: Support-vector networks, Machine Learning, 1995.
- Yann LeCun, Yoshua Bengio, Geoffrey Hinton: Deep learning, Nature, 2015.
- NIST: Towards a Standard for Identifying and Managing Bias in Artificial Intelligence, 2022.
- NIST: Artificial Intelligence Risk Management Framework (AI RMF 1.0), 2023.
Praktické odpovede
Často kladené otázky
Aký je rozdiel medzi AI a strojovým učením?
AI je širšia oblasť. Strojové učenie je jeden z jej prístupov, pri ktorom sa správanie modelu odvodzuje z dát namiesto úplného ručného naprogramovania pravidiel.
Čo je preučenie modelu?
Model sa príliš prispôsobí tréningovým príkladom a dosahuje slabšie výsledky na nových dátach. Preto sa kvalita overuje na oddelených dátach.
Potrebuje strojové učenie vždy veľké dáta?
Nie vždy. Potrebné množstvo závisí od zložitosti úlohy, kvality dát, typu modelu a možnosti využiť už predtrénovaný systém.
Najlepšie porozumenie vzniká, keď si zhrniete tri hlavné myšlienky vlastnými slovami.
Prihlásiť / registrovať