Створення словника й корпусу
Щоб запустити тематичну модель LDA, спершу потрібно створити словник і корпус, адже саме їх ви передаватимете в модель. Ви продовжите працювати з очищеним текстом, підготовленим у попередніх вправах. Це означає, що text_clean уже доступний для подальшої роботи, і ви використаєте його, щоб створити словник і корпус.
Ця вправа виконуватиметься трохи довше, ніж зазвичай.
Ця вправа є частиною курсу
Виявлення шахрайства в Python
Інструкції до вправи
- Імпортуйте пакет gensim і окремо corpora з gensim.
- Створіть словник, викликавши відповідну функцію для очищених даних
text_clean. - Створіть корпус, запустивши
doc2bowдля кожного фрагмента тексту вtext_clean. - Виведіть результати, щоб побачити, як виглядають
dictionaryіcorpus.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)