LDA 結果の確認
メインキャラクターの Napoleon に言及している『Animal Farm』の文を対象に、5 つのトピックからなるトピックモデル napoleon_model を作成しました。各トピックについて、上位の単語と上位の文を 5 人のローカル著者にレビューしてもらい、各トピックのテーマを提示してもらっています。
最終結果として、各トピックの要約統計量を準備しましょう。これらの要約値をテーマとあわせて上司に提出します。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
- トピックモデル
napoleon_modelから gamma 行列を抽出します。 dplyrの関数を使って、各文で最も確からしいトピックを示す tibblegrouped_gammasを作成します。grouped_gammasを用いて、各トピックに最も近い文の数を数えます。grouped_gammasを使って、各トピックの gamma の平均値を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Extract the gamma matrix
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
___(document) %>%
___(desc(gamma)) %>%
___(1) %>%
___(topic)
# Count (tally) by topic
grouped_gammas %>%
___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>%
___(avg=mean(gamma)) %>%
___(desc(avg))