檢視 LDA 結果
你已經為《動物農莊》中提到主角 Napoleon 的句子建立了一個包含 5 個主題的主題模型 napoleon_model。你找了 5 位在地作者檢視每個主題的代表詞與代表句,並針對各主題提供了對應的主題方向。
為了彙整成果,請準備一些關於主題的摘要統計。你會把這些摘要數值與主題方向一併呈交給主管審閱。
本練習屬於課程
R 的自然語言處理入門
練習說明
- 從主題模型
napoleon_model擷取 gamma 矩陣。 - 使用
dplyr函式建立一個名為grouped_gammas的 tibble,內容為每個句子的最高主題。 - 使用
grouped_gammas統計最接近各主題的句子數量。 - 使用
grouped_gammas計算各主題的平均 gamma 值。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Extract the gamma matrix
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
___(document) %>%
___(desc(gamma)) %>%
___(1) %>%
___(topic)
# Count (tally) by topic
grouped_gammas %>%
___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>%
___(avg=mean(gamma)) %>%
___(desc(avg))