开始使用免费开始使用

两极化标签云

共性云图会显示文档之间共享的词。不过,它无法告诉您这些共有词在某个文档中是否比另一个文档更常见。要比较这种差异,您需要使用金字塔图;可以通过 plotrix 包中的 pyramid.plot() 来生成。

首先,需要对数据做一些整理,使其适合作图。最简单的方法是将其转换为数据框并使用 dplyr。给定一个词频矩阵(如由 as.matrix(tdm) 创建的矩阵),您需要得到一个包含 3 列的数据框:

  • 每个文档中包含的词。
  • 文档 1 中这些词的计数。
  • 文档 2 中这些词的计数。

然后使用 pyramid.plot()

pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)

还可以通过一些附加参数来改善图形的外观。

现在,您将探索在 chardonnay 推文中常见、但在 coffee 推文中罕见的词。all_dtm_m 已为您创建。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

top25_df <- all_tdm_m %>%
  # Convert to data frame
  as_tibble(rownames = "___") %>% 
  # Keep rows where word appears everywhere
  filter(if_all(everything(), ___) %>% 
  # Get difference in counts
  mutate(difference = ___) %>% 
  # Keep rows with biggest difference
  slice_max(___,  n = ___) %>% 
  # Arrange by descending difference
  arrange(___(___))
编辑并运行代码