開始使用免費開始

將主題指派給文件

建立 LDA 模型如果不能解讀並運用結果,就沒有意義。你已獲得在一句句的文字 pig_sentences 上執行 LDA 模型 sentence_lda 的結果。你需要同時探索 beta(各主題的高頻詞)與 gamma(每份文件的主要主題)這兩個矩陣,才能完整理解任何 LDA 分析的結果。

根據你對這兩個矩陣的了解,請擷取特定主題的結果,並檢查輸出是否符合預期。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • betagamma 兩個矩陣各建立一個 tibble。
  • 透過檢視第 5 主題的高頻詞來探索主題 5,並依 beta 值遞減排序結果。
  • 透過檢視最貼近主題 5 的句子來探索主題 5,並依 gamma 值遞減排序結果。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")

# Explore Topic 5 Betas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)

# Explore Topic 5 Gammas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)
編輯並執行程式碼