始める無料で始める

辞書とコーパスを作成する

LDA のトピックモデルを実行するには、まず辞書とコーパスを定義する必要があります。これらはモデルに渡します。前の演習で作成したクリーンなテキストデータを引き続き使います。つまり、text_clean はすでに利用可能で、これを使って辞書とコーパスを作成します。

この演習は通常より少し実行に時間がかかります。

この演習はコースの一部です

Pythonで学ぶ不正検知

コースを見る

演習の手順

  • gensim パッケージ全体と、gensim から corpora を個別にインポートします。
  • クリーンデータ text_clean に対して適切な関数を実行し、辞書を定義します。
  • text_clean の各テキストに対して doc2bow を実行し、コーパスを定義します。
  • dictionarycorpus がどのようなものか確認できるように、結果を出力してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
コードを編集して実行