兩極化標籤雲
共通性雲(commonality clouds)會顯示文件之間共同出現的詞。不過,它無法告訴你哪些詞在某一份文件中比另一份更常見。若要比較兩邊的差異,你需要使用金字塔圖(pyramid plot);可以用 plotrix 套件的 pyramid.plot() 產生。
在此之前,需要先整理資料成合適的格式。最簡單的方式是轉成資料框,並使用 dplyr。給定一個由 as.matrix(tdm) 建立的詞頻矩陣,你最後需要得到一個具有 3 欄的資料框:
- 每份文件中包含的詞。
- 文件 1 中這些詞的計數。
- 文件 2 中這些詞的計數。
接著使用 pyramid.plot():
pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)
還可以透過一些額外參數來美化圖表的外觀。
現在你要找出在 chardonnay 推文中常見、但在 coffee 推文中較少見的詞。all_dtm_m 已為你建立。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
top25_df <- all_tdm_m %>%
# Convert to data frame
as_tibble(rownames = "___") %>%
# Keep rows where word appears everywhere
filter(if_all(everything(), ___) %>%
# Get difference in counts
mutate(difference = ___) %>%
# Keep rows with biggest difference
slice_max(___, n = ___) %>%
# Arrange by descending difference
arrange(___(___))