Slovník výrazov AI/Multimodálna AI

Multimodálna AI

zvukovo-jazykový model

Anglický výraz audio-language model

základnéheslo č. 8055 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená zvukovo-jazykový model?

Zvukovo-jazykový model spája zvukovú reprezentáciu s textom alebo jazykovým dekóderom. Môže vyhľadávať klipy podľa opisu, pomenúvať zvukové udalosti, odpovedať na otázky o nahrávke alebo generovať text podmienený rečou, hudbou či prostredím.

Skúsenosť a kontext

Ako sa pojem používa v praxi

V archíve nahrávok používateľ vyhľadá „zvonenie bicykla v premávke“. Systém zoradí klipy podľa zvukovo-textovej podobnosti a ukáže časový úsek, nie iba názov súboru. Hodnotenie používa ľudsky posúdenú relevanciu a kontroluje dominanciu hlasitosti či šumu.

Overiteľnosť

Odborné zdroje

  1. Elizalde et al. - CLAP: Learning Audio Concepts From Natural Language Supervisionarxiv.org
  2. Baltrušaitis et al. - Multimodal Machine Learning: A Survey and Taxonomyarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje zvukovo-jazykový model?

Audio enkóder spracuje vlnu alebo spektrogram a zarovná ju s textovým enkóderom, prípadne odovzdá zvukové tokeny jazykovému dekóderu.

Kedy má zvukovo-jazykový model praktický význam?

V archíve nahrávok používateľ vyhľadá „zvonenie bicykla v premávke“.

S čím si pojem nezamieňať?

ASR prepisuje hovorené slová; audio-language model môže interpretovať aj nerečové zvuky a vzťahy opísané prirodzeným jazykom.

Ako sa výsledok kontroluje?

Meria sa retrieval recall, captioning metriky s ľudskou kontrolou, presnosť udalostí, časové ukotvenie, robustnosť šumu a kalibrácia.

Na čo si dať pozor?

Model môže priradiť opis podľa prostredia v pozadí a ignorovať cieľový zvuk alebo zameniť súčasné udalosti za príčinný vzťah.