Создание словаря и корпуса
Чтобы запустить тематическую модель LDA, сначала необходимо определить словарь и корпус — они понадобятся в качестве входных данных для модели. Вы продолжите работу с очищенными текстовыми данными из предыдущих упражнений. Переменная text_clean уже доступна, и вы будете использовать её для создания словаря и корпуса.
Выполнение этого упражнения может занять немного больше времени, чем обычно.
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Импортируйте пакет gensim и отдельно модуль corpora из gensim.
- Создайте словарь, применив соответствующую функцию к очищенным данным
text_clean. - Создайте корпус, применив
doc2bowк каждому тексту вtext_clean. - Выведите результаты на экран, чтобы посмотреть, как выглядят
dictionaryиcorpus.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)