Model spája informácie medzi modalitami, no každá má vlastné chyby.
Text, obraz, zvuk a video predstavujú odlišné vstupy a úlohy. Multimodálny systém ich môže prepájať, ale kvalitu treba overiť pre každú konkrétnu funkciu.
Po prečítaní budete vedieť
- vysvetliť hlavný princíp na vlastnom príklade
- rozlíšiť údaj, odhad a vykonanú akciu
- určiť, čo treba pred použitím výsledku skontrolovať
Fotografia bločka, zvuk prednášky a video z dielne obsahujú informácie v rôznych podobách. Systém môže z každej z nich vytvoriť text, ale cesta k textu nie je rovnaká. Obraz potrebuje zachytiť priestorové vzťahy, zvuk priebeh v čase a video navyše súvislosť medzi snímkami.
Modalita je druh informácie alebo spôsob jej zachytenia. Text, obraz a zvuk sú typické príklady. Multimodálny systém pracuje s viacerými takými podobami. Neznamená to, že každú zvláda rovnako dobre alebo že jediný model vykonáva všetky kroky.
Vstup a výstup treba pomenovať osobitne
Pri posudzovaní nástroja si zapíšte, čo prijíma a čo vytvára. Systém obraz-text opisuje obrázok. Text-obraz generuje vizuál podľa pokynu. Zvuk-text prepisuje reč. Text-zvuk môže čítať napísaný obsah syntetickým hlasom.
Rozdiel je praktický. Nástroj, ktorý dokáže opísať fotografiu, nemusí vedieť upraviť jej vybranú časť. Nástroj, ktorý vie vytvoriť hlas, nemusí poskytovať spoľahlivú identifikáciu hovoriaceho. Zručnosti sa nesmú odvodzovať iba z podobného rozhrania.
Niektoré produkty spájajú samostatné modely. Prepisovač vytvorí text, jazykový model pripraví odpoveď a syntéza vytvorí zvuk. Iné architektúry spracúvajú viac modalít spoločne. Pre používateľa môže byť výsledok podobný, ale zdroje chýb sa líšia.
Text obsahuje význam aj štruktúru
Pri texte model pracuje s reprezentáciami tokenov a kontextu. Úlohou môže byť triedenie, vyhľadanie pasáže, preklad alebo generovanie. V každom prípade záleží na tom, či má zachovať presný údaj alebo vytvoriť nový návrh.
Dokument nie je iba súvislý text. Nadpisy, tabuľky a poznámky určujú vzťahy medzi informáciami. Ak sa pri extrakcii stratia stĺpce tabuľky, číslo môže zostať čitateľné, ale priradiť sa k nesprávnej kategórii.
V modelovej cenníkovej tabuľke je cena bez dane v prvom stĺpci a cena s daňou v druhom. Textový výstup bez zachovaného označenia môže obe ceny pomiešať. Jazykový model potom spracúva chybne usporiadaný podklad.
Pri práci s dokumentom preto najprv overte extrakciu. Chyby v rozložení, chýbajúce strany alebo nečitateľné bunky nie sú problémom, ktorý vyrieši lepší štýl odpovede.
Obraz sa reprezentuje číslami a vzťahmi
Digitálny obraz obsahuje pixely s farebnými hodnotami. Model môže využívať lokálne oblasti alebo menšie časti obrazu. Výskum vision transformeru ukázal prístup, pri ktorom sa obraz spracúva ako sekvencia častí. Dosovitskiy a kolektív, 2020.
Rozpoznanie obrazu zahŕňa viac rôznych úloh. Klasifikácia odhaduje kategóriu obrázka. Detekcia určuje aj polohu objektov. Segmentácia priraďuje označenie oblastiam alebo pixelom. Opis fotografie vytvára jazykový text.
Ak systém povie „na obrázku je auto“, nemusí vedieť presne vyznačiť všetky jeho hranice. Ak vyznačí predmet, nemusí správne určiť konkrétny model vozidla. Úloha a úroveň podrobnosti musia byť jasné.
Na modelovej fotografii ulice môže časť vozidla zakrývať strom. Človek dokáže domyslieť tvar, ale neviditeľná časť nie je priamo pozorovaná. Model môže vytvoriť podobný odhad. Pri dokumentovaní skutočnosti však musíme odlíšiť viditeľný detail od domnienky.
OCR číta znaky, opis obrazu vysvetľuje scénu
OCR, optické rozpoznávanie znakov, prevádza písmo v obraze na text. Je to iná úloha než všeobecné vysvetlenie obsahu obrázka. Moderná aplikácia môže obe schopnosti spájať.
Predstavte si fotografiu oznamu s drobným písmom. Systém môže správne rozpoznať, že ide o oznam knižnice, ale nesprávne prečítať dátum. Celkový opis vyzerá presvedčivo, hoci kľúčový údaj je chybný.
Pri presnom prepise žiadajte zachovanie textu a označenie nečitateľných častí. Ak sa časť nedá odčítať, doplnenie podľa očakávaného významu mení úlohu na rekonštrukciu. Tú treba označiť.
Praktická kontrola závisí od účelu. Pri pomoci s orientáciou môže stačiť všeobecný opis. Pri termíne podujatia alebo čísle účtu potrebujeme overiť konkrétne znaky v origináli.
Text a obraz možno spojiť cez spoločnú reprezentáciu
Výskum CLIP sa učil prepájať obrazy s textovými opismi. Takéto reprezentácie umožňujú porovnávať obraz s jazykovým opisom a podporujú úlohy, ktoré sa nedajú obmedziť na pevný zoznam ručne označených kategórií. Radford a kolektív, 2021.
V modelovej zbierke fotografií sa môže vyhľadávať podľa vety „drevený most nad potokom“. Systém potrebuje prepojiť jazykový opis s vizuálnymi vlastnosťami. Nejde o jednoduché porovnanie názvu súboru.
Podobnosť je však stále odhad. Fotografia môže obsahovať most, ale nie drevený. Vyhľadávanie môže byť užitočné pri prezeraní zbierky, no presný opis konkrétneho záberu treba skontrolovať.
Takto sa multimodalita stáva praktickou funkciou. Umožňuje zadať potrebu jednou modalitou a nájsť obsah v druhej. Neznamená neobmedzené porozumenie scény.
Generovanie obrazu vytvára obsah podľa podmienok
Generatívny obrazový model vytvára nový obraz podľa zadania a naučených vzťahov. Jednou významnou rodinou sú difúzne modely. Pri tréningu sa učia pracovať s postupne zašumenými dátami a pri generovaní využívajú obrátený proces. Ho, Jain a Abbeel, 2020.
Vysvetlenie „odstraňovanie šumu“ je pomôcka k mechanizmu, nie tvrdenie, že systém iba čistí už existujúcu fotografiu. Pri tvorbe môže začínať z náhodnej reprezentácie a generovať obsah podmienený textom alebo obrazom.
Inou historicky významnou rodinou sú generatívne adversariálne siete, GAN. Ich tréning spája generátor a diskriminátor v súperiacom procese. Generátor vytvára vzorky a diskriminátor rozlišuje ich pôvod. Goodfellow a kolektív, 2014.
Nie každý súčasný obrazový produkt používa jednu verejne známu architektúru. Nástroj môže kombinovať viac postupov. Používateľ má hodnotiť splnenie zadania, nie odhadovať mechanizmus iba podľa vzhľadu výstupu.
Realistický obraz nemusí byť pravdivý
Model môže vytvoriť presvedčivú scénu námestia, ktorá nikdy neexistovala. Pri ilustrácii je to prípustný cieľ. Pri spravodajstve alebo dokumentácii musí byť syntetický obsah odlíšený od záznamu udalosti.
Ak chcete vysvetliť technický detail, krásna ilustrácia nemusí byť vhodná. Počet častí, ich poloha a rozmery môžu byť nesprávne. Pri presnom nákrese je vhodnejší nástroj, ktorý zachováva určené geometrické a textové údaje.
V modelovej úlohe vytvorenia kalendára môže vzniknúť čitateľný nadpis a nesprávne usporiadané dni. Vizuálna kvalita a vecná presnosť sú dve hodnotenia. Potrebujeme obe, ak má obraz slúžiť na učenie.
Zvuk obsahuje reč aj ďalšie udalosti
Zvuk je časový signál. Systém môže rozpoznávať slová, zvukové udalosti, hovoriacich alebo hudobnú štruktúru. Tieto úlohy majú rozdielne požiadavky a chyby.
Prepis reči môže zlyhať pri prekryve hlasov, šume, vlastných menách alebo slabom zázname. Výskum Whisper je príkladom rozsiahleho učenia rozpoznávania reči, nie zárukou správnosti všetkých mien a čísel. Radford a kolektív, 2022.
Diarizácia priraďuje časti záznamu jednotlivým hovoriacim. Nie je automaticky overením ich občianskej identity. Označenie hovoriaci jeden môže iba rozlišovať hlas v zázname.
V modelovej porade sa dvaja účastníci prekryjú. Systém môže priradiť záväzok nesprávnej osobe. Kontrola zápisnice preto potrebuje overiť nielen text, ale aj to, kto danú informáciu vyslovil.
Syntetický hlas mení spôsob prezentácie
Syntéza reči vytvára zvuk z textu alebo iného vstupu. Môže podporovať prístupnosť, čítanie materiálov a tvorbu zvukového obsahu. Podoba hlasu, výslovnosť a intonácia ovplyvňujú porozumenie.
Pri vzdelávacom texte môže nesprávny dôraz zmeniť význam. Číslo, skratka a cudzí názov môžu vyžadovať osobitnú kontrolu. Kvalitne znejúci hlas ešte neznamená správnu výslovnosť každého odborného pojmu.
Napodobňovanie hlasu konkrétneho človeka vytvára ďalšie otázky oprávnenia a transparentnosti. Poslucháč by nemal automaticky predpokladať, že znejúci hlas predstavuje autentický výrok danej osoby.
Video pridáva časovú súvislosť
Video nie je iba jeden obrázok. Obsahuje sled snímok a často zvuk. Na pochopenie činnosti treba sledovať poradie, pohyb a zmeny. Veta „človek vzal pohár“ sa nedá vždy odvodiť z jediného statického záberu.
Pri analýze dlhého videa systém nemusí spracovať každú snímku rovnakým spôsobom. Môže vyberať vzorky alebo pracovať so zhrnutou reprezentáciou. Krátka udalosť medzi vzorkami sa môže stratiť.
V modelovom videu montáže pracovník na chvíľu otočí diel. Ak túto fázu systém nezachytí, opis postupu môže pôsobiť plynulo, ale vynechať dôležitú orientáciu. Pre presný návod preto treba kontrolovať konkrétne úseky a nadväznosť krokov.
Pri generovaní videa sa pridáva požiadavka časovej konzistencie. Predmet by mal zostať rovnaký, pohyb má nadväzovať a príčina má predchádzať následku. Vizuálne pôsobivý krátky klip nemusí byť fyzikálne alebo procedurálne správny.
Multimodálne systémy môžu spájať aj vnímanie a konanie
Výskum PaLM-E skúmal jazykový model s ďalšími vstupmi spojenými s fyzickým prostredím. RT-2 neskôr skúmal prenos vizuálnych a jazykových reprezentácií do robotických akcií. Driess a kolektív, 2023; Brohan a kolektív, 2023.
Takéto práce ukazujú výskumnú cestu, nie automatickú pripravenosť robota na každú domácnosť. Fyzické konanie potrebuje zvládnuť vzdialenosť, silu, prekážky aj dôsledky chyby.
V modelovej kuchyni môže systém správne pomenovať pohár, ale nesprávne odhadnúť úchop. Vizuálne rozpoznanie a bezpečná manipulácia sú rozdielne schopnosti. Úspech prvej nemožno použiť ako dôkaz druhej.
Čítajte mapu od východiska cez súvislosť až po dôsledok. Spoločným jadrom je „Jeden systém, viac druhov vstupu“.
Keď sa modality nezhodujú
Predstavte si obrázok s nápisom „otvorené v sobotu“ a zvukovú správu „v sobotu máme zatvorené“. Systém by nemal bez vysvetlenia vybrať jednu informáciu ako platnú. Potrebuje posúdiť pôvod, dátum a kontext.
Multimodalita môže poskytnúť viac dôkazov, ale aj viac rozporov. Zhodná informácia v dvoch vstupoch môže podporiť dôveru. Rozpor má byť dôvodom na kontrolu, nie na plynulé doplnenie chýbajúceho príbehu.
Pre používateľa je vhodný pokyn, aby systém oddelil, čo číta v texte, čo vidí na obraze a čo iba odhaduje. Takéto členenie pomáha kontrole, hoci samo osebe nie je zárukou správnosti.
Modelový projekt: sprístupnenie návodu z viacerých podkladov
Vzdelávacie centrum má starý naskenovaný návod, zvukový komentár lektora a krátke video s ukážkou. Chce pripraviť prístupnú webovú verziu. Predpokladajme, že ide o jednoduché skladanie papierovej pomôcky. Cieľom je zachovať presné kroky, nie vytvoriť voľnú ilustráciu podobnej činnosti.
Najprv si zapíšeme úlohu každej modality. Sken obsahuje názvy a rozmery. Zvuk vysvetľuje dôvody postupu a jednu výnimku. Video ukazuje orientáciu papiera a poradie pohybov. Žiadny podklad samostatne neobsahuje všetko. Systém, ktorý spracuje iba prepis reči, môže vynechať vizuálne podstatný detail.
Výstup má tiež viac častí: textový návod, obrázky jednotlivých fáz a titulky videa. Pri každej určujeme samostatné kritériá. Text musí zachovať podmienky, obrázky správnu orientáciu a titulky význam prejavu. Všetky časti potom porovnáme medzi sebou, aby neuvádzali rozdielne poradie.
Takto vymedzené zadanie pomáha vybrať vhodné nástroje. Rozhovorové rozhranie môže celý proces uľahčiť, ale samo nepreukazuje, že spracovalo sken, zvuk aj video úplne. Potrebujeme viditeľné a kontrolovateľné výsledky jednotlivých krokov.
Prvý krok: zistiť, čo dokument skutočne obsahuje
Pri naskenovanom dokumente overíme počet strán a ich poradie. Pozrieme sa, či sa nestratil okraj, legenda alebo časť tabuľky. Rozpoznávanie môže dostať iba obsah, ktorý je v súbore dostupný. Ak chýba posledná strana, plynulé doplnenie záveru by bolo vytváraním nového obsahu.
Pri pracovnom liste môže byť text rozdelený do dvoch stĺpcov. Nesprávne poradie čítania spojí začiatok jednej vety s koncom inej. Výsledok môže obsahovať všetky rozpoznané slová a predsa nedávať pôvodný význam. Kontrola preto zahŕňa aj štruktúru, nie iba zoznam znakov.
Číselné údaje preverujeme priamo v obraze. Rozmer pätnásť centimetrov a päťdesiat centimetrov môže odlišovať jediný znak. Jazykový kontext nemusí chybu odhaliť. Ak je číslo nečitateľné, označíme neistotu a vyžiadame lepší podklad namiesto odhadu.
Po extrakcii si ponecháme väzbu na originál. Pri každom dôležitom údaji má byť možné nájsť miesto, z ktorého pochádza. To uľahčuje neskoršiu kontrolu aj opravu, keď sa objaví rozpor so zvukovým komentárom.
Tabuľka potrebuje hlavičku a jednotky
Predstavme si tabuľku dvoch verzií papierovej pomôcky. Jeden stĺpec obsahuje šírku, druhý výšku a riadky označujú veľkosť. Ak sa tieto vzťahy pri čítaní stratia, samotné čísla už neurčujú správne rozmery. Model môže zameniť riadok alebo stĺpec bez zjavne nezmyselnej vety.
Najprv preto obnovíme štruktúrovaný zápis. Zachováme názvy stĺpcov, jednotku aj prípadnú poznámku pod tabuľkou. Potom overíme niekoľko konkrétnych buniek v origináli. Pri kritických rozmeroch kontrolujeme všetky použité hodnoty, nie iba vizuálny vzhľad tabuľky.
Podobný problém vzniká pri grafe. Číslo potrebuje os, jednotku a kategóriu. Popis „hodnota stúpa“ nemusí stačiť, ak graf ukazuje rôzne série alebo nerovnomerné časové intervaly. Vizuálny odhad tiež nemusí poskytovať presné číslo.
Výstup označíme podľa povahy údajov. Presne prečítaná hodnota, približný odhad z grafu a vypočítaný výsledok sú odlišné informácie. Čitateľ má vedieť, na akom základe ich používa.
Prepis zvuku a zápis významu
Lektor môže pri ukážke povedať „túto hranu teraz neprekladajte“. Ak prepis vynechá negáciu, vznikne opačný pokyn. Pri kontrole preto venujeme pozornosť krátkym slovám, ktoré menia význam, aj keď zvyšok vety znie prirodzene.
Doslovný prepis a upravený návod sú dve fázy. Najprv potrebujeme vedieť, čo zaznelo. Potom môžeme odstrániť výplňové slová a usporiadať vysvetlenie. Ak robíme oboje naraz bez kontroly, nejasnú pasáž môže model upraviť na význam, ktorý lektor nepovedal.
Pri pauze alebo šume sa môže časť informácie stratiť. Správny postup je označiť nejasné miesto a podľa potreby ho znovu vypočuť. Odvodenie zo skenu môže pomôcť pri interpretácii, ale máme vedieť, že ide o kombinovanie podkladov.
Pri viacerých hovoriacich overujeme aj priradenie. Otázka účastníka nie je automaticky pokynom lektora. Ak sa v zápise zmení na odporúčanie, výsledok môže byť vecne nesprávny napriek presne rozpoznaným slovám.
Časová značka vytvára väzbu na konkrétnu ukážku
Časové značky umožňujú nájsť miesto v zázname, kde sa informácia objavila. Pri viacstupňovom návode pomáhajú porovnať text s pohybom. Neznamenajú však, že prepis alebo interpretácia sú správne len preto, že obsahujú presný čas.
V modelovom videu lektor začne vysvetľovať ďalší krok skôr, než dokončí pohyb. Zvuk a obraz teda nemusia opisovať tú istú fázu v každom okamihu. Pri príprave návodu potrebujeme zachytiť vzťah, nie mechanicky spojiť vetu s jednou snímkou.
Skontrolujeme aj prípadný posun zvuku. Ak sa zvuková stopa oneskoruje, rovnaká časová značka nemusí ukazovať správnu činnosť. Pri samostatne nahratom komentári je väzba ešte menej priama. Také podmienky treba zohľadniť pred automatickým spájaním.
Časová kontrola je zvlášť užitočná pri vynechaní krátkeho kroku. Namiesto všeobecného zhrnutia môžeme preskúmať konkrétny úsek. Získame tak lepší podklad na rozhodnutie, či je návod úplný.
Video treba hodnotiť ako sled udalostí
Pri papierovej pomôcke je dôležité, čo sa urobilo skôr. Otočenie listu pred preložením a po preložení môže viesť k odlišnému výsledku. Jednotlivé pekné obrázky preto nemusia stačiť na správnu rekonštrukciu postupu.
Pripravíme zoznam pozorovaných udalostí a ich nadväzností. Pri každej určíme, ktoré časti sú viditeľné a čo kamera zakrýva. Ak ruka prekryje detail, nemôžeme jeho presnú polohu prezentovať ako priamo pozorovanú. Môžeme ju overiť z ďalšej ukážky alebo označiť potrebu doplnenia.
Ak systém analyzuje vybrané snímky, krátky pohyb sa môže stratiť. Je preto vhodné porovnať navrhnutý zoznam krokov s plynulým prehratím. Kontrola jedného zastaveného záberu nemusí potvrdiť poradie ani skutočný smer pohybu.
Pri vzdelávacom návode nakoniec skúšame, či sa podľa výsledku dá úloha vykonať. To odhalí chýbajúce prechody, ktoré si skúsený autor domyslel. Praktická skúška však má zodpovedať bezpečnosti a náročnosti konkrétnej činnosti.
Odkazy typu „tu“ potrebujú priestorový kontext
V reči často používame „sem“, „na túto stranu“ alebo „tento roh“. Bez obrazu môže byť prepis úplne správny, ale nepoužiteľný. Multimodálny postup potrebuje spojiť výraz s relevantnou časťou scény.
V modelovej ukážke lektor ukazuje ľavý horný roh zo svojej perspektívy. Divák môže vidieť zrkadlovo obrátený obraz. Preto treba pri finálnom návode určiť referenčný pohľad. Slovo ľavý musí mať jasný význam pre človeka, ktorý postup vykonáva.
Aj označenie pomocou súradníc závisí od obrazu. Po orezaní alebo otočení snímky sa poloha zmení. Ak prenášame značku medzi verziami, potrebujeme zachovať zodpovedajúcu transformáciu. Inak šípka môže ukazovať na nesprávne miesto.
Pri kontrole používame jasné pomenovania a konzistentný pohľad. Návod môže uviesť, že smer sa posudzuje z pohľadu osoby pracujúcej s pomôckou. Taká jednoduchá veta odstráni nejasnosť, ktorú samotná kvalita modelu nevyrieši.
Generovaná ilustrácia a dokumentačná fotografia
Pre titulný obrázok pracovného listu môžeme chcieť voľnú ilustráciu. Pre vysvetlenie skladania potrebujeme presný stav papiera. Tieto účely majú rozdielne požiadavky. Vizuál, ktorý pôsobí príjemne, môže mať nesprávny počet prehybov a viesť žiaka k chybnému kroku.
Pri technicky presnom obrázku kontrolujeme všetky podstatné vzťahy. Kde je hrana, ktorá časť prekrýva inú a ako sa označujú rozmery? Ak má byť obraz dôkazom vykonanej činnosti, generovaný obsah nemôže nahradiť skutočný záznam.
Aj úprava existujúcej fotografie môže doplniť detail, ktorý pôvodne nebol viditeľný. Pri tvorivej úprave je to prípustný zámer. Pri dokumentácii označíme zásah a nespoliehame sa na výsledok ako na pôvodné pozorovanie.
V pracovnom materiáli sa oplatí uviesť funkciu obrazu. Ilustrácia, schéma a fotografia sú rôzne druhy podkladov. Čitateľ potom vie, či má očakávať presné rozmery, zjednodušený vzťah alebo záznam konkrétnej situácie.
Zlepšenie čitateľnosti nemusí obnoviť pôvodný detail
Nástroj môže zväčšiť obraz a vytvoriť ostrejšie pôsobiace hrany. Pri veľmi slabom pôvodnom zázname však jemné detaily nemusia byť jednoznačne určené. Generatívna rekonštrukcia môže doplniť pravdepodobnú podobu namiesto obnovy skutočnej informácie.
Pri nečitateľnom nápise preto neprezentujeme zvýraznený výsledok ako nezávislý dôkaz presného znenia. Porovnáme originál, prípadne vyhľadáme iný záznam. Ak sa znak nedá overiť, zostáva nejasný aj v prípade esteticky presvedčivej úpravy.
Rozdiel medzi čistením signálu a vytváraním detailu závisí od konkrétneho postupu. Používateľ nemusí poznať všetky algoritmy, ale má rozumieť tejto hranici. Slovo vylepšenie nehovorí, aká časť výstupu pochádza z pôvodných údajov.
Pre vzdelávací web je vhodné uchovať originál a opis úpravy. Pri presných údajoch používame kontrolu mimo upraveného výstupu. Tak sa z pohodlného nástroja nestane zdroj neviditeľne vytvorených faktov.
Alt text má slúžiť konkrétnemu čitateľovi
Alternatívny text pomáha sprostredkovať význam obrazu ľuďom, ktorí ho nevidia alebo si ho nemôžu zobraziť. Automatický všeobecný opis však nemusí zodpovedať účelu obrázka na stránke. Fotografia pomôcky môže byť dekoráciou alebo nositeľom presného kroku.
Ak obraz ukazuje správnu orientáciu, alt text by mal zachytiť potrebný vzťah. Veta „papier na stole“ síce opisuje scénu, ale nepomáha vykonať úlohu. Pri zložitom postupe môže byť vhodnejšie doplniť plnohodnotné textové vysvetlenie priamo v obsahu.
Text tiež nemá tvrdiť neviditeľné podrobnosti. Ak systém odhaduje materiál alebo identitu osoby, taký odhad nemusí patriť do popisu. Zameriavame sa na význam potrebný pre čitateľa a overiteľný obsah.
Prístupnosť preto nehodnotíme iba podľa existencie poľa s opisom. Skúmame, či opis umožňuje pochopiť podstatnú informáciu a nadväzuje na okolitý text. Automatický návrh môže šetriť prácu, ale potrebuje túto obsahovú kontrolu.
Model spája informácie medzi modalitami, no každá má vlastné chyby. Náčrt použite ako krátku kontrolu pred praktickým rozhodnutím.
Titulky a syntetická reč potrebujú vlastnú kontrolu
Titulky majú zachovať význam prejavu a zodpovedať jeho časovaniu. Nesprávne priradená veta môže divákovi zmeniť poradie pokynov. Pri rýchlej ukážke môže byť aj správny text nepraktický, ak sa zobrazuje príliš krátko na prečítanie.
Syntetická reč zase vyžaduje kontrolu výslovnosti a čísel. Zápis rozmeru alebo skratky môže nástroj prečítať inak, než zamýšľal autor. Výsledný hlas nemusí byť vhodný len preto, že má prirodzenú intonáciu.
Pri materiáli pre začiatočníkov zohľadníme aj tempo. Nový pojem môže potrebovať pauzu alebo vysvetlenie. Text vhodný na tiché čítanie sa nemusí bez úpravy rovnako dobre počúvať. Príprava zvukovej verzie je preto aj pedagogická úloha.
Výsledok preveríme prehratím celej relevantnej časti. Samotný pohľad na textový podklad neodhalí časovanie ani výslovnosť. Táto kontrola patrí k danej modalite a nemožno ju úplne nahradiť kontrolou inej.
Pôvod záznamu mení interpretáciu
Dve fotografie rovnakého miesta môžu pochádzať z iného obdobia. Video môže byť zostrihané a zvuk dodatočne nahratý. Obsah jednotlivých vstupov preto interpretujeme spolu s informáciou o ich pôvode, dátume a účele.
Modelový oznam na fotografii uvádza starý termín. Nový zvukový komentár ho opravuje. Ak systém bez kontroly spojí oba podklady, môže vytvoriť zmes starých a nových údajov. Rozpor sa nemá vyriešiť odhadom, ale zistením platnosti.
Metadáta môžu pri orientácii pomôcť, ale ani tie nemusia byť úplné alebo nezmenené. Názov súboru nie je vždy dátum vzniku obsahu. Pri rozhodujúcom údaji potrebujeme primerane spoľahlivú oporu.
V praxi sa preto oplatí viesť zoznam podkladov s ich funkciou a známymi obmedzeniami. Umožní kontrolovať, ktorá informácia bola podkladom pre konkrétny krok. Pri neskoršej aktualizácii vieme určiť, čo treba znovu preveriť.
Kombinácia modalít nemusí priniesť nezávislé potvrdenie
Textový prepis a zvukový záznam môžu vyzerať ako dva zdroje. Ak prepis vznikol z toho istého zvuku, nejde o dve nezávislé potvrdenia. Rovnaká chyba môže prejsť z prvého spracovania do všetkých ďalších podôb.
Podobne titulky vytvorené z nesprávneho prepisu a návod odvodený z titulkov môžu zhodne uvádzať chybný údaj. Ich zhoda podporuje konzistentnosť, ale sama neoveruje pôvodnú informáciu. Kontrola sa musí vrátiť k vhodnému originálu.
Multimodalita môže byť silnou pomocou, ak obraz poskytuje detail chýbajúci v reči. Jej prínos však závisí od skutočného obsahu a vzťahu vstupov. Počet formátov nemeriame ako počet nezávislých dôkazov.
Pri pedagogickej úlohe nechajte študenta nakresliť pôvod jednotlivých výstupov v jednoduchom zozname. Z ktorého záznamu vznikol prepis a z čoho návod? Tak ľahšie rozpozná, kde sa jedna chyba mohla opakovane šíriť.
Výsledná kontrola modelového návodu
Pred publikovaním porovnáme rozmery so skenom, formulácie so zvukom a poradie s videom. Potom skontrolujeme, či všetky verzie hovoria o rovnakej pomôcke a rovnakom variante. Zámenu variantov môže zakryť veľmi podobný vzhľad aj slovník.
Prejdeme návod z pohľadu človeka bez skúsenosti. Je jasné, ktorú stranu otočiť? Obsahuje vysvetlenie neobvyklého pojmu? Ak treba vidieť detail, existuje aj textové vyjadrenie podstatného vzťahu? Tieto otázky hodnotia použiteľnosť, nie iba technické spracovanie.
Chýbajúci krok doplníme z overeného podkladu alebo ho označíme ako autorskú úpravu, ktorú sme samostatne preverili. Nevytvárame dojem, že sa nachádzal v pôvodnom videu. Tým zachováme transparentný vzťah medzi zdrojom a výsledným materiálom.
Nakoniec si ponecháme pracovný záznam o opravách. Pri ďalšej aktualizácii nebudeme opakovať tie isté chyby v čítaní a prepisovaní. Tak multimodálne nástroje pomáhajú vytvoriť kvalitnejší obsah bez straty kontroly nad jeho významom.
Rozpoznávanie zvukových udalostí
Nie každý zvukový model prepisuje reč. Môže rozlišovať typy zvukov alebo vyhľadávať udalosť v nahrávke. V modelovom archíve chce autor nájsť miesta, kde zaznie zvonček. Cieľom nie sú slová, ale časový úsek s určitou zvukovou charakteristikou.
Aj tu treba definovať kategóriu. Má sa počítať každý podobný tón alebo iba konkrétny zvonček v miestnosti? Ak záznam obsahuje hudbu s podobným zvukom, všeobecná podobnosť môže vytvoriť nesprávne označenie. Vhodný test musí zahrnúť aj takéto zámenné prípady.
Výstup môže označovať začiatok a koniec udalosti. Presnosť kategórie a presnosť času hodnotíme osobitne. Model môže správne zachytiť, že zvonček zaznel, ale vyznačiť príliš široký úsek. Pri strihaní nahrávky to môže byť praktický problém.
Ak udalosti prekrýva reč, potrebujeme preveriť výkon v takých podmienkach. Čistá ukážka samostatného zvuku neoveruje rušné prostredie. Tento príklad rozširuje predstavu o zvukovej AI za hranice hlasových asistentov.
Hudobný obsah a textové pomenovanie
Hudobný systém môže hľadať podobnosť nahrávok, odhadovať vlastnosti alebo vytvárať nový obsah. Textový pokyn „pokojná hudba“ však nemá jediný presný význam. Pre rôznych poslucháčov môže znamenať odlišné tempo, nástroje či intenzitu.
V modelovej tvorbe vzdelávacieho videa preto autor určí funkciu hudby. Má tvoriť tiché pozadie bez prekrývania reči. Výsledok hodnotí počúvaním v spojení s komentárom, nie izolovane. Aj vhodná samostatná skladba môže zhoršiť zrozumiteľnosť prejavu.
Pri analýze odlišujeme merateľnú vlastnosť od interpretácie. Odhad tempa je iný druh výstupu než označenie nálady. Nálada môže byť užitočnou kategóriou pre vyhľadávanie, ale nepredstavuje objektívny opis každého poslucháčovho zážitku.
Ak nástroj vytvára hudbu, posudzujeme aj podmienky jej použitia. Konkrétne oprávnenia závisia od služby a podkladov. Technická možnosť stiahnuť zvuk sama neodpovedá na otázku, za akých podmienok ho môžeme publikovať.
Preklad reči má viac miest na významovú zmenu
Pri postupe zvuk, prepis a preklad môže chyba prepisu prejsť do druhého jazyka. Ak sa zmení meno alebo negácia, preklad môže byť gramaticky správny vzhľadom na chybný vstup. Kontrola iba výslednej slovenčiny tak nestačí.
Predstavme si lektora, ktorý uvádza dva podobné odborné názvy. Prepisovač ich spojí do jedného. Prekladateľský model potom vytvorí jednotný slovenský termín. Čitateľ nevidí pôvodnú nejasnosť, pokiaľ sa uchová a preverí väzba na zvuk.
Pri dôležitých informáciách preto porovnáme výsledok s pôvodným prejavom. Ak kontrolór neovláda pôvodný jazyk, potrebujeme vhodnú jazykovú pomoc. Prirodzený preklad nie je samostatným dokladom správnosti zdrojového významu.
Výsledný text môže potrebovať aj pedagogickú úpravu. Preklad odborného termínu vysvetlíme podľa publika a zachováme jeho význam. Zjednodušenie má sprístupniť pojem, nie nahradiť ho nesúvisiacim bežným slovom.
Odborné podklady k prístupnosti
Vhodnú textovú alternatívu určuje účel obrázka v konkrétnom kontexte. Tento princíp vysvetľuje W3C WAI: Images Tutorial. Dekoratívny obraz a obraz nesúci potrebnú informáciu nemajú rovnakú funkciu. Pri zložitom obsahu môže byť potrebný rozsiahlejší textový ekvivalent.
Pri titulkoch treba zachytiť aj dôležité zvukové informácie mimo reči a vhodne ich synchronizovať. Praktické vysvetlenie poskytuje W3C WAI: Captions/Subtitles. Automaticky vytvorené titulky potrebujú overenie a opravy; ich samotná dostupnosť nepreukazuje správnosť.
Tieto zdroje pomáhajú oddeliť návrh vytvorený AI od kvalitného publikovaného výsledku. Autor musí posúdiť, akú informáciu má čitateľ alebo poslucháč získať, a skontrolovať, či ju výsledná podoba skutočne sprostredkuje.
Úloha: určte miesto kontroly
Máte naskenovaný oznam, zvukové vysvetlenie a krátke video. Chcete pripraviť presný návod. Kde potrebujete kontrolu textu, kde času a kde významu?
Pri skene overte čísla a rozloženie. Pri zvuku mená, negácie a priradenie výrokov. Pri videu poradie a úplnosť krokov. V konečnom návode skontrolujte, či sa jednotlivé podklady neodporujú a či systém nepridal krok, ktorý nebol doložený.
Výsledná kvalita multimodálneho systému závisí od každej z týchto častí. Počet podporovaných vstupných formátov je iba začiatok hodnotenia. Rozhodujúce je, či z nich vytvorí správny a použiteľný výsledok pre konkrétnu úlohu.
Pri úlohe si môžete pripraviť aj jednoduchú mapu pôvodu: ktorý údaj pochádza zo skenu, ktorý zo zvuku a ktorý z videa. Ak všetky tri verzie čerpajú z jediného pôvodného oznamu, zaznamenajte aj túto väzbu. Pri rozpore potom ľahšie určíte, či vznikol v pôvodnom obsahu alebo počas spracovania. Taký záznam nemusí byť súčasťou publikovaného návodu, ale pomáha autorovi pri overovaní. Pri následnej oprave sa dá zistiť, ktoré výstupy treba aktualizovať spoločne. Inak môže byť text opravený, zatiaľ čo titulky alebo zvuková verzia naďalej uvádzajú starý údaj. Kontrola má preto zahŕňať všetky aktuálne používané podoby obsahu.
Pojmy v slovníku
multimodálny model (multimodal model)
Zhrnutie kapitoly
Text, obraz, zvuk a video predstavujú odlišné vstupy a úlohy. Multimodálny systém ich môže prepájať, ale kvalitu treba overiť pre každú konkrétnu funkciu.
Praktické odpovede
Často kladené otázky
Čo je hlavná myšlienka kapitoly „Ako AI pracuje s textom, obrazom, zvukom a videom“?
Text, obraz, zvuk a video predstavujú odlišné vstupy a úlohy. Multimodálny systém ich môže prepájať, ale kvalitu treba overiť pre každú konkrétnu funkciu.
Potrebujem na pochopenie programovanie?
Nie. Kapitola vysvetľuje princípy na modelových situáciách. Sledujte vstup, úlohu, výsledok a spôsob kontroly; matematické detaily nie sú podmienkou.
Ako si overím, že téme rozumiem?
Vyberte si iný príklad než v texte a vlastnými slovami vysvetlite postup. Pomenujte informácie, ktoré systém dostáva, jeho obmedzenia a človeka, ktorý skontroluje výsledok.
Najlepšie porozumenie vzniká, keď si zhrniete tri hlavné myšlienky vlastnými slovami.
Prihlásiť / registrovať