將主題指派給文件
建立 LDA 模型如果不能解讀並運用結果,就沒有意義。你已獲得在一句句的文字 pig_sentences 上執行 LDA 模型 sentence_lda 的結果。你需要同時探索 beta(各主題的高頻詞)與 gamma(每份文件的主要主題)這兩個矩陣,才能完整理解任何 LDA 分析的結果。
根據你對這兩個矩陣的了解,請擷取特定主題的結果,並檢查輸出是否符合預期。
本練習屬於課程
R 的自然語言處理入門
練習說明
- 為
beta與gamma兩個矩陣各建立一個 tibble。 - 透過檢視第 5 主題的高頻詞來探索主題 5,並依
beta值遞減排序結果。 - 透過檢視最貼近主題 5 的句子來探索主題 5,並依
gamma值遞減排序結果。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)