Analiza wyników LDA
Zbudowano model tematyczny napoleon_model z 5 tematami dla zdań z książki Folwark zwierzęcy, które odnoszą się do głównego bohatera – Napoleona. Pięciu lokalnych autorów przejrzało najważniejsze słowa i zdania dla każdego tematu i zaproponowało odpowiednie etykiety tematyczne.
Aby sfinalizować wyniki, przygotuj podsumowanie statystyk dotyczących poszczególnych tematów. Przedstawisz te wartości razem z etykietami tematycznymi swojemu przełożonemu do oceny.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Wyodrębnij macierz gamma z modelu tematycznego
napoleon_model. - Użyj funkcji z pakietu
dplyr, aby utworzyć tibble zawierający dominujący temat dla każdego zdania – nazwij gogrouped_gammas. - Korzystając z
grouped_gammas, policz liczbę zdań najbardziej odpowiadających każdemu tematowi. - Korzystając z
grouped_gammas, oblicz średnią wartość gamma dla każdego tematu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Extract the gamma matrix
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
___(document) %>%
___(desc(gamma)) %>%
___(1) %>%
___(topic)
# Count (tally) by topic
grouped_gammas %>%
___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>%
___(avg=mean(gamma)) %>%
___(desc(avg))