LDA の練習
あなたの大好きな新しい本『Animal Farm』で、登場人物 Napoleon をめぐる共通のテーマに関心があります。Napoleon は仲間の動物たちを説得して人間の支配者を打倒させるブタで、最終的には Animal Farm の新しいリーダーになります。
Napoleon の名前が出てくるすべての文を pig_sentences に抽出し、ストップワードを除去してステミングも行ったトークン化データを pig_tokens として作成しました。これらの文に対して LDA を実行し、各トピックに関連する上位の単語を確認してください。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
pig_matrixに対して LDA を実行し、トピック数は 10 に設定します。再現性のため乱数シードを1111に設定してください。- 結果から beta 行列を抽出します。
- beta 行列をトピック 2 のみにフィルタし、beta の値が大きい順に並べ替えます。
- beta 行列をトピック 3 のみにフィルタし、beta の値が大きい順に並べ替えます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
library(topicmodels)
# Perform Topic Modeling
sentence_lda <-
___(___, k = ___, method = 'Gibbs', control = list(seed = ___))
# Extract the beta matrix
sentence_betas <- ___(sentence_lda, matrix = "___")
# Topic #2
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)
# Topic #3
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)