Tilldela ämnen till dokument
LDA-modeller är meningslösa om du inte kan tolka och använda resultaten. Du har fått resultaten från en LDA-modell, sentence_lda, som körts på en uppsättning meningar, pig_sentences. För att fullt ut förstå resultaten av en LDA-analys behöver du utforska både beta-matrisen – de vanligaste orden per ämne – och gamma-matrisen – de mest framträdande ämnena per dokument.
Använd din kunskap om dessa två matriser för att extrahera resultaten för ett specifikt ämne och kontrollera om utdata stämmer överens med förväntningarna.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Skapa en tibble för både
beta- ochgamma-matriserna. - Utforska ämne 5 genom att titta på de vanligaste orden för ämne 5 och sortera resultaten efter fallande
beta-värden. - Utforska ämne 5 genom att se vilka meningar som bäst stämmer överens med ämne 5 och sortera resultaten efter fallande
gamma-värden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)