两极化标签云
共性云图会显示文档之间共享的词。不过,它无法告诉您这些共有词在某个文档中是否比另一个文档更常见。要比较这种差异,您需要使用金字塔图;可以通过 plotrix 包中的 pyramid.plot() 来生成。
首先,需要对数据做一些整理,使其适合作图。最简单的方法是将其转换为数据框并使用 dplyr。给定一个词频矩阵(如由 as.matrix(tdm) 创建的矩阵),您需要得到一个包含 3 列的数据框:
- 每个文档中包含的词。
- 文档 1 中这些词的计数。
- 文档 2 中这些词的计数。
然后使用 pyramid.plot():
pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)
还可以通过一些附加参数来改善图形的外观。
现在,您将探索在 chardonnay 推文中常见、但在 coffee 推文中罕见的词。all_dtm_m 已为您创建。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
交互式实操练习
通过完成这段示例代码来试试这个练习。
top25_df <- all_tdm_m %>%
# Convert to data frame
as_tibble(rownames = "___") %>%
# Keep rows where word appears everywhere
filter(if_all(everything(), ___) %>%
# Get difference in counts
mutate(difference = ___) %>%
# Keep rows with biggest difference
slice_max(___, n = ___) %>%
# Arrange by descending difference
arrange(___(___))