始める無料で始める

LDA モデル

いよいよLDA モデルを構築します。dictionarycorpus を使って、Enron のメールにどんなトピックが含まれているかを探っていきます。各トピックに割り当てられた単語をさっと出力してみると、目立つトピックがあるかどうかの初期確認ができます。なお、トピックモデルは計算コストが高いため、実行に時間がかかります。さっそく試してみましょう。

この演習はコースの一部です

Pythonで学ぶ不正検知

コースを見る

演習の手順

  • gensim の models から LDA モデルを構築し、corpusdictionary を渡してください。
  • モデルの結果に対して print でトピックを出力し、5 つのトピックを保存し、各トピックの上位 5 語を取得してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)

# Save the topics and top 5 words
topics = ____.____(num_words=____)

# Print the results
for topic in topics:
    print(topic)
コードを編集して実行