ドキュメントへのトピック割り当て
LDAモデルは、結果を解釈して活用できなければ意味がありません。ここでは、文集合pig_sentencesに対してLDAモデルsentence_ldaを実行した結果が与えられています。任意のLDA分析の結果を正しく理解するには、トピックごとの上位語を表すbetaと、ドキュメントごとの上位トピックを表すgammaの両方の行列を確認する必要があります。
これら2つの行列に関する知識を踏まえて、特定のトピックの結果を抽出し、出力が期待どおりかを確認しましょう。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
beta行列とgamma行列の両方についてtibbleを作成します。- トピック5を調べるため、トピック5の上位語を
betaの値が大きい順に並べて確認します。 - トピック5を調べるため、トピック5に最も一致する文を
gammaの値が大きい順に並べて確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)