辞書とコーパスを作成する
LDA のトピックモデルを実行するには、まず辞書とコーパスを定義する必要があります。これらはモデルに渡します。前の演習で作成したクリーンなテキストデータを引き続き使います。つまり、text_clean はすでに利用可能で、これを使って辞書とコーパスを作成します。
この演習は通常より少し実行に時間がかかります。
この演習はコースの一部です
Pythonで学ぶ不正検知
演習の手順
- gensim パッケージ全体と、gensim から corpora を個別にインポートします。
- クリーンデータ
text_cleanに対して適切な関数を実行し、辞書を定義します。 text_cleanの各テキストに対してdoc2bowを実行し、コーパスを定義します。dictionaryとcorpusがどのようなものか確認できるように、結果を出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)