Atribuirea topicurilor documentelor
Modelele LDA nu sunt utile dacă nu poți interpreta și folosi rezultatele. Ți-au fost furnizate rezultatele unui model LDA, sentence_lda, aplicat pe un set de propoziții, pig_sentences. Trebuie să explorezi atât matricea beta – cele mai frecvente cuvinte pe topic – cât și matricea gamma – topicurile dominante per document – pentru a înțelege pe deplin rezultatele oricărei analize LDA.
Usând ceea ce știi despre aceste două matrice, extrage rezultatele pentru un topic specific și verifică dacă rezultatul corespunde așteptărilor.
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Creează un tibble pentru matricele
betașigamma. - Explorează topicul 5 uitându-te la cele mai frecvente cuvinte pentru topicul 5, ordonând rezultatele descrescător după valorile
beta. - Explorează topicul 5 identificând propozițiile care se aliniază cel mai bine cu topicul 5, ordonând rezultatele descrescător după valorile
gamma.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)