ПочатиПочніть безкоштовно

Створення словника й корпусу

Щоб запустити тематичну модель LDA, спершу потрібно створити словник і корпус, адже саме їх ви передаватимете в модель. Ви продовжите працювати з очищеним текстом, підготовленим у попередніх вправах. Це означає, що text_clean уже доступний для подальшої роботи, і ви використаєте його, щоб створити словник і корпус.

Ця вправа виконуватиметься трохи довше, ніж зазвичай.

Ця вправа є частиною курсу

Виявлення шахрайства в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте пакет gensim і окремо corpora з gensim.
  • Створіть словник, викликавши відповідну функцію для очищених даних text_clean.
  • Створіть корпус, запустивши doc2bow для кожного фрагмента тексту в text_clean.
  • Виведіть результати, щоб побачити, як виглядають dictionary і corpus.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
Редагувати та запускати код