LDA モデル
いよいよLDA モデルを構築します。dictionary と corpus を使って、Enron のメールにどんなトピックが含まれているかを探っていきます。各トピックに割り当てられた単語をさっと出力してみると、目立つトピックがあるかどうかの初期確認ができます。なお、トピックモデルは計算コストが高いため、実行に時間がかかります。さっそく試してみましょう。
この演習はコースの一部です
Pythonで学ぶ不正検知
演習の手順
- gensim の models から LDA モデルを構築し、
corpusとdictionaryを渡してください。 - モデルの結果に対して
printでトピックを出力し、5 つのトピックを保存し、各トピックの上位 5 語を取得してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)
# Save the topics and top 5 words
topics = ____.____(num_words=____)
# Print the results
for topic in topics:
print(topic)