Granska LDA-resultat
Du har utvecklat en ämnesmodell, napoleon_model, med 5 ämnen för meningarna i boken Djurfarmen som refererar till huvudkaraktären Napoleon. Fem lokala författare har granskat de vanligaste orden och meningarna för varje ämne och gett dig teman för vart och ett av dem.
Avsluta arbetet genom att ta fram sammanfattande statistik om ämnena. Du presenterar dessa värden tillsammans med temana för din chef.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Extrahera gamma-matrisen från ämnesmodellen
napoleon_model. - Använd
dplyr-funktioner för att skapa en tibble med det mest framträdande ämnet i varje mening – kalla dengrouped_gammas. - Använd
grouped_gammasför att räkna antalet meningar som bäst motsvarar varje ämne. - Använd
grouped_gammasoch beräkna det genomsnittliga gammavärdet för varje ämne.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Extract the gamma matrix
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
___(document) %>%
___(desc(gamma)) %>%
___(1) %>%
___(topic)
# Count (tally) by topic
grouped_gammas %>%
___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>%
___(avg=mean(gamma)) %>%
___(desc(avg))