Slovník výrazov AI/Multimodálna AI

Multimodálna AI

model LLaVA

Anglický výraz LLaVA model

špecializovanéheslo č. 8485 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená model LLaVA?

LLaVA je rodina veľkých vizuálno-jazykových asistentov, ktorá spája predtrénovaný vizuálny enkóder s veľkým jazykovým modelom a dolaďuje ich na vizuálno-inštrukčných dátach. Pôvodná architektúra používa projekciu obrazových príznakov do jazykového priestoru a generuje textové odpovede.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Interný asistent vysvetľuje fotografie zariadení, ale musí uviesť, keď detail nie je čitateľný. Tím dolaďuje iba na povolených dátach a testuje neznáme modely strojov, malé texty a zavádzajúce inštrukcie vložené do obrazu.

Overiteľnosť

Odborné zdroje

  1. Liu et al. - Visual Instruction Tuningarxiv.org
  2. McKinzie et al. - MM1: Methods, Analysis & Insights from Multimodal LLM Pre-trainingarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje model LLaVA?

Vizuálny encoder vytvorí príznaky, projekčná vrstva ich prevedie na tokeny pre jazykový model a inštrukčné ladenie učí odpovede na obrazovo-textové pokyny.

Kedy má model LLaVA praktický význam?

Interný asistent vysvetľuje fotografie zariadení, ale musí uviesť, keď detail nie je čitateľný.

S čím si pojem nezamieňať?

Flamingo cieli najmä na multimodálne few-shot učenie z prekladaného kontextu; LLaVA zdôrazňuje vizuálne inštrukčné ladenie konverzačného asistenta.

Ako sa výsledok kontroluje?

Meria sa VQA, grounding, plnenie inštrukcií, OCR, halucinácie, robustnosť prompt injection a výkon mimo tréningových obrazov.

Na čo si dať pozor?

Syntetické inštrukčné dáta môžu preniesť nepravdivé odpovede a jazykový model môže dominovať nad slabým vizuálnym signálom.