開始使用免費開始

兩極化標籤雲

共通性雲(commonality clouds)會顯示文件之間共同出現的詞。不過,它無法告訴你哪些詞在某一份文件中比另一份更常見。若要比較兩邊的差異,你需要使用金字塔圖(pyramid plot);可以用 plotrix 套件的 pyramid.plot() 產生。

在此之前,需要先整理資料成合適的格式。最簡單的方式是轉成資料框,並使用 dplyr。給定一個由 as.matrix(tdm) 建立的詞頻矩陣,你最後需要得到一個具有 3 欄的資料框:

  • 每份文件中包含的詞。
  • 文件 1 中這些詞的計數。
  • 文件 2 中這些詞的計數。

接著使用 pyramid.plot()

pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)

還可以透過一些額外參數來美化圖表的外觀。

現在你要找出在 chardonnay 推文中常見、但在 coffee 推文中較少見的詞。all_dtm_m 已為你建立。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

top25_df <- all_tdm_m %>%
  # Convert to data frame
  as_tibble(rownames = "___") %>% 
  # Keep rows where word appears everywhere
  filter(if_all(everything(), ___) %>% 
  # Get difference in counts
  mutate(difference = ___) %>% 
  # Keep rows with biggest difference
  slice_max(___,  n = ___) %>% 
  # Arrange by descending difference
  arrange(___(___))
編輯並執行程式碼