НачатьНачать бесплатно

Создание словаря и корпуса

Чтобы запустить тематическую модель LDA, сначала необходимо определить словарь и корпус — они понадобятся в качестве входных данных для модели. Вы продолжите работу с очищенными текстовыми данными из предыдущих упражнений. Переменная text_clean уже доступна, и вы будете использовать её для создания словаря и корпуса.

Выполнение этого упражнения может занять немного больше времени, чем обычно.

Это упражнение является частью курса

Обнаружение мошенничества на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте пакет gensim и отдельно модуль corpora из gensim.
  • Создайте словарь, применив соответствующую функцию к очищенным данным text_clean.
  • Создайте корпус, применив doc2bow к каждому тексту в text_clean.
  • Выведите результаты на экран, чтобы посмотреть, как выглядят dictionary и corpus.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
Редактировать и запускать код