Trénování LDA modelu
Je čas spustit svůj první model témat! Jak jsme probírali, tři dodatečné argumenty funkce LDA() jsou klíčové pro správné spuštění modelu. Počítej s tím, že funkce LDA() může trvat přibližně 10 sekund. Balíčky tidyverse a tidytext spolu s datasetem tidy_twitter jsou už načtené.
Toto cvičení je součástí kurzu
Úvod do analýzy textu v R
Pokyny k cvičení
- Načti balíček
topicmodels. - Převeď počty slov v tweetech do DTM.
- Spusť LDA se 2 tématy a Gibbsovým samplerem.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the topicmodels package
___
# Cast the word counts by tweet into a DTM
dtm_twitter <- ___ %>%
___(___) %>%
___(___)
# Run an LDA with 2 topics and a Gibbs sampler
lda_out <- LDA(
___,
k = ___,
method = ___,
control = list(seed = 42)
)