Обучение модели LDA
Пришло время запустить вашу первую тематическую модель! Как уже обсуждалось, три дополнительных аргумента функции LDA() играют ключевую роль в корректном построении тематической модели. Обратите внимание, что выполнение функции LDA() может занять около 10 секунд. Пакеты tidyverse и tidytext, а также набор данных tidy_twitter уже загружены.
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Загрузите пакет
topicmodels. - Преобразуйте частоты слов по твитам в DTM.
- Запустите LDA с 2 темами, используя сэмплер Гиббса.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the topicmodels package
___
# Cast the word counts by tweet into a DTM
dtm_twitter <- ___ %>%
___(___) %>%
___(___)
# Run an LDA with 2 topics and a Gibbs sampler
lda_out <- LDA(
___,
k = ___,
method = ___,
control = list(seed = 42)
)