Zacznij terazZacznij za darmo

Analiza wyników LDA

Zbudowano model tematyczny napoleon_model z 5 tematami dla zdań z książki Folwark zwierzęcy, które odnoszą się do głównego bohatera – Napoleona. Pięciu lokalnych autorów przejrzało najważniejsze słowa i zdania dla każdego tematu i zaproponowało odpowiednie etykiety tematyczne.

Aby sfinalizować wyniki, przygotuj podsumowanie statystyk dotyczących poszczególnych tematów. Przedstawisz te wartości razem z etykietami tematycznymi swojemu przełożonemu do oceny.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyodrębnij macierz gamma z modelu tematycznego napoleon_model.
  • Użyj funkcji z pakietu dplyr, aby utworzyć tibble zawierający dominujący temat dla każdego zdania – nazwij go grouped_gammas.
  • Korzystając z grouped_gammas, policz liczbę zdań najbardziej odpowiadających każdemu tematowi.
  • Korzystając z grouped_gammas, oblicz średnią wartość gamma dla każdego tematu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Extract the gamma matrix 
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
  ___(document) %>%
  ___(desc(gamma)) %>%
  ___(1) %>%
  ___(topic)
# Count (tally) by topic
grouped_gammas %>% 
  ___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>% 
  ___(avg=mean(gamma)) %>%
  ___(desc(avg))
Edytuj i uruchom kod