Slovník výrazov AI/Učenie bez učiteľa

Učenie bez učiteľa

pravdepodobnostná latentná sémantická analýza

Anglický výraz probabilistic latent semantic analysis

pokročiléheslo č. 1895 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená pravdepodobnostná latentná sémantická analýza?

Pravdepodobnostná latentná sémantická analýza (pLSA/pLSI) modeluje každý výskyt slova v dokumente cez latentnú tému: dokument má vlastnú zmes tém a téma rozdelenie slov. Parametre sa zvyčajne odhadujú EM algoritmom. Na rozdiel od LDA základná pLSA nemá generatívny prior pre zmesi nových dokumentov, takže počet dokumentových parametrov rastie s korpusom.

Skúsenosť a kontext

Ako sa pojem používa v praxi

V dokumentovo-slovných počtoch sa inicializujú tematické distribúcie a EM strieda posteriorné priradenia slov k témam s aktualizáciou parametrov. Viac behov obmedzí riziko slabého lokálneho maxima. Počet tém sa volí na držaných dátach a podľa koherencie. Pre nový dokument treba pri pevných témach osobitne odhadnúť jeho zmes, pretože základný model nemá Dirichletov prior ako LDA. Veľký počet parametrov zvyšuje riziko prefitovania; regularizácia alebo Bayesian model môže byť vhodnejší.

Overiteľnosť

Odborné zdroje

  1. Hofmann · Probabilistic latent semantic indexingdoi.org
  2. Blei, Ng, Jordan · LDAjmlr.org

Praktické odpovede

Často kladené otázky

Čo sprostredkuje vzťah dokumentu a slova?

Skrytá téma vybraná pre konkrétny výskyt slova.

Ako sa model trénuje?

Často EM algoritmom nad posteriornými priradeniami tém.

Aký je hlavný rozdiel oproti LDA?

pLSA nemá v základnej forme apriórne rozdelenie, ktoré generuje zmes tém pre dokument.

Prečo rastú s korpusom?

Každý tréningový dokument má vlastnú množinu tematických parametrov.

Ako sa spracuje?

Pri pevných témach sa dodatočne odhadne jeho zmes, napríklad „fold-in“ postupom.