開始使用免費開始

檢視 LDA 結果

你已經為《動物農莊》中提到主角 Napoleon 的句子建立了一個包含 5 個主題的主題模型 napoleon_model。你找了 5 位在地作者檢視每個主題的代表詞與代表句,並針對各主題提供了對應的主題方向。

為了彙整成果,請準備一些關於主題的摘要統計。你會把這些摘要數值與主題方向一併呈交給主管審閱。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • 從主題模型 napoleon_model 擷取 gamma 矩陣。
  • 使用 dplyr 函式建立一個名為 grouped_gammas 的 tibble,內容為每個句子的最高主題。
  • 使用 grouped_gammas 統計最接近各主題的句子數量。
  • 使用 grouped_gammas 計算各主題的平均 gamma 值。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Extract the gamma matrix 
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
  ___(document) %>%
  ___(desc(gamma)) %>%
  ___(1) %>%
  ___(topic)
# Count (tally) by topic
grouped_gammas %>% 
  ___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>% 
  ___(avg=mean(gamma)) %>%
  ___(desc(avg))
編輯並執行程式碼