Модель LDA
Пришло время построить модель LDA. Используя dictionary и corpus, вы готовы выявить темы, присутствующие в письмах Enron. Быстрый вывод слов, связанных с каждой темой, позволит провести первичный анализ и понять, есть ли среди них очевидно выраженные. Имейте в виду, что тематическая модель требует значительных вычислительных ресурсов, поэтому выполнение займёт некоторое время. Попробуем!
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Постройте модель LDA на основе модулей gensim, подставив
corpusиdictionary. - Сохраните 5 тем, вызвав функцию вывода тем на результатах модели, и выберите топ-5 слов для каждой темы.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)
# Save the topics and top 5 words
topics = ____.____(num_words=____)
# Print the results
for topic in topics:
print(topic)