ÎncepețiÎncepe gratuit

Atribuirea topicurilor documentelor

Modelele LDA nu sunt utile dacă nu poți interpreta și folosi rezultatele. Ți-au fost furnizate rezultatele unui model LDA, sentence_lda, aplicat pe un set de propoziții, pig_sentences. Trebuie să explorezi atât matricea beta – cele mai frecvente cuvinte pe topic – cât și matricea gamma – topicurile dominante per document – pentru a înțelege pe deplin rezultatele oricărei analize LDA.

Usând ceea ce știi despre aceste două matrice, extrage rezultatele pentru un topic specific și verifică dacă rezultatul corespunde așteptărilor.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un tibble pentru matricele beta și gamma.
  • Explorează topicul 5 uitându-te la cele mai frecvente cuvinte pentru topicul 5, ordonând rezultatele descrescător după valorile beta.
  • Explorează topicul 5 identificând propozițiile care se aliniază cel mai bine cu topicul 5, ordonând rezultatele descrescător după valorile gamma.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")

# Explore Topic 5 Betas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)

# Explore Topic 5 Gammas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)
Editează și rulează codul