Slovník výrazov AI/Multimodálna AI

Multimodálna AI

video-jazykový model

Anglický výraz video-language model

základnéheslo č. 8065 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená video-jazykový model?

Video-jazykový model prepája sekvenciu obrazových snímok a často zvuk s textom. Musí reprezentovať poradie, trvanie a zmeny v čase, preto odpoveď nemá vychádzať iba z jednej vybranej snímky. Používa sa na titulkovanie, otázky, vyhľadávanie a časové ukotvenie.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Kontrola výrobnej linky vyhľadá vo videu krok, pri ktorom chýbal bezpečnostný kryt. Model vráti opis aj časový interval a pracovník overí pôvodný záznam. Test obsahuje rovnaké objekty v inom poradí, dlhé nečinné úseky a udalosti viditeľné len krátko.

Overiteľnosť

Odborné zdroje

  1. Liu et al. - Temporal Sentence Grounding in Videos: A Surveyarxiv.org
  2. Alayrac et al. - Flamingo: a Visual Language Model for Few-Shot Learningarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje video-jazykový model?

Časový vizuálny enkóder agreguje snímky alebo video tokeny a jazykový modul nad nimi dekóduje text či skóruje textovo-video páry.

Kedy má video-jazykový model praktický význam?

Kontrola výrobnej linky vyhľadá vo videu krok, pri ktorom chýbal bezpečnostný kryt.

S čím si pojem nezamieňať?

Obrazovo-jazykový model môže opisovať jeden záber; video-language model musí zachytiť udalosti a vzťahy medzi zábermi v čase.

Ako sa výsledok kontroluje?

Kontroluje sa presnosť udalostí, citlivosť na poradie snímok, temporal grounding, výkon pri dlhom videu, audio ablation a halucinácie.

Na čo si dať pozor?

Riedke vzorkovanie môže preskočiť krátku udalosť a model môže odvodiť dej zo začiatku alebo názvu videa bez sledovania zmeny.