始める無料で始める

LDA の練習

あなたの大好きな新しい本『Animal Farm』で、登場人物 Napoleon をめぐる共通のテーマに関心があります。Napoleon は仲間の動物たちを説得して人間の支配者を打倒させるブタで、最終的には Animal Farm の新しいリーダーになります。

Napoleon の名前が出てくるすべての文を pig_sentences に抽出し、ストップワードを除去してステミングも行ったトークン化データを pig_tokens として作成しました。これらの文に対して LDA を実行し、各トピックに関連する上位の単語を確認してください。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • pig_matrix に対して LDA を実行し、トピック数は 10 に設定します。再現性のため乱数シードを 1111 に設定してください。
  • 結果から beta 行列を抽出します。
  • beta 行列をトピック 2 のみにフィルタし、beta の値が大きい順に並べ替えます。
  • beta 行列をトピック 3 のみにフィルタし、beta の値が大きい順に並べ替えます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

library(topicmodels)
# Perform Topic Modeling
sentence_lda <-
  ___(___, k = ___, method = 'Gibbs', control = list(seed = ___))
# Extract the beta matrix 
sentence_betas <- ___(sentence_lda, matrix = "___")

# Topic #2
sentence_betas %>%
  ___(topic == ___) %>%
  arrange(-___)
# Topic #3
sentence_betas %>%
  ___(topic == ___) %>%
  arrange(-___)
コードを編集して実行