开始使用免费开始使用

可视化不相似的词

假设您想要可视化不重合的词。为此,您也可以使用 comparison.cloud(),步骤与之前类似,但有一个关键区别。

与查找共现词时一样,先将推文合并成各自独立的语料库,并将它们组合到一个 VCorpus() 对象中。接着应用 clean_corpus() 函数,并将其组织为一个 TermDocumentMatrix

为了区分哪些词属于 coffee,哪些属于 chardonnay,您可以像下面这样设置 TDM 的列名:

colnames(all_tdm) <- c("chardonnay", "coffee")

最后,使用 as.matrix() 将对象转换为矩阵,以便在 comparison.cloud() 中使用。对于传入 comparison.cloud() 的每个独立语料库,您都可以指定颜色,例如 colors = c("red", "yellow", "green"),以便让各部分更易区分。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

all_corpus 已预加载到您的工作空间。

  • 通过对 all_corpus 应用预定义的 clean_corpus 函数创建 all_clean
  • all_clean 创建一个 TermDocumentMatrix,命名为 all_tdm
  • 使用 colnames() 重命名 all_tdm 中各自独立的语料库。将第一列命名为 "coffee",第二列命名为 "chardonnay"。
  • all_tdm 转换为矩阵形式,创建 all_m
  • 使用 all_m 创建一个 comparison.cloud(),并设置 colors = c("orange", "blue")max.words = 50

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Clean the corpus
___ <- ___(___)

# Create all_tdm
___ <- ___(___)

# Give the columns distinct names
___(___) <- ___

# Create all_m
___ <- ___(___)

# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)
编辑并运行代码