始める無料で始める

ドキュメントへのトピック割り当て

LDAモデルは、結果を解釈して活用できなければ意味がありません。ここでは、文集合pig_sentencesに対してLDAモデルsentence_ldaを実行した結果が与えられています。任意のLDA分析の結果を正しく理解するには、トピックごとの上位語を表すbetaと、ドキュメントごとの上位トピックを表すgammaの両方の行列を確認する必要があります。

これら2つの行列に関する知識を踏まえて、特定のトピックの結果を抽出し、出力が期待どおりかを確認しましょう。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • beta行列とgamma行列の両方についてtibbleを作成します。
  • トピック5を調べるため、トピック5の上位語をbetaの値が大きい順に並べて確認します。
  • トピック5を調べるため、トピック5に最も一致する文をgammaの値が大きい順に並べて確認します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")

# Explore Topic 5 Betas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)

# Explore Topic 5 Gammas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)
コードを編集して実行