Presná definícia
Čo znamená pravdepodobnostná latentná sémantická analýza?
Pravdepodobnostná latentná sémantická analýza (pLSA/pLSI) modeluje každý výskyt slova v dokumente cez latentnú tému: dokument má vlastnú zmes tém a téma rozdelenie slov. Parametre sa zvyčajne odhadujú EM algoritmom. Na rozdiel od LDA základná pLSA nemá generatívny prior pre zmesi nových dokumentov, takže počet dokumentových parametrov rastie s korpusom.
Skúsenosť a kontext
Ako sa pojem používa v praxi
V dokumentovo-slovných počtoch sa inicializujú tematické distribúcie a EM strieda posteriorné priradenia slov k témam s aktualizáciou parametrov. Viac behov obmedzí riziko slabého lokálneho maxima. Počet tém sa volí na držaných dátach a podľa koherencie. Pre nový dokument treba pri pevných témach osobitne odhadnúť jeho zmes, pretože základný model nemá Dirichletov prior ako LDA. Veľký počet parametrov zvyšuje riziko prefitovania; regularizácia alebo Bayesian model môže byť vhodnejší.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo sprostredkuje vzťah dokumentu a slova?
Skrytá téma vybraná pre konkrétny výskyt slova.
Ako sa model trénuje?
Často EM algoritmom nad posteriornými priradeniami tém.
Aký je hlavný rozdiel oproti LDA?
pLSA nemá v základnej forme apriórne rozdelenie, ktoré generuje zmes tém pre dokument.
Prečo rastú s korpusom?
Každý tréningový dokument má vlastnú množinu tematických parametrov.
Ako sa spracuje?
Pri pevných témach sa dodatočne odhadne jeho zmes, napríklad „fold-in“ postupom.
Prihlásiť / registrovať