Przypisywanie tematów do dokumentów
Tworzenie modeli LDA nie ma sensu, jeśli nie potrafisz interpretować i wykorzystywać ich wyników. Otrzymujesz wyniki działania modelu LDA, sentence_lda, na zbiorze zdań pig_sentences. Aby w pełni zrozumieć rezultaty analizy LDA, musisz zbadać zarówno macierz beta – zawierającą najważniejsze słowa dla każdego tematu – jak i macierz gamma – zawierającą dominujące tematy dla każdego dokumentu.
Wykorzystaj swoją wiedzę o tych dwóch macierzach: wyodrębnij wyniki dla konkretnego tematu i sprawdź, czy dane wyjściowe spełniają oczekiwania.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Utwórz tibble dla macierzy
betaigamma. - Zbadaj temat 5, sprawdzając najważniejsze słowa dla tego tematu – posortuj wyniki malejąco według wartości
beta. - Zbadaj temat 5, sprawdzając, które zdania najlepiej do niego pasują – posortuj wyniki malejąco według wartości
gamma.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)