可视化不相似的词
假设您想要可视化不重合的词。为此,您也可以使用 comparison.cloud(),步骤与之前类似,但有一个关键区别。
与查找共现词时一样,先将推文合并成各自独立的语料库,并将它们组合到一个 VCorpus() 对象中。接着应用 clean_corpus() 函数,并将其组织为一个 TermDocumentMatrix。
为了区分哪些词属于 coffee,哪些属于 chardonnay,您可以像下面这样设置 TDM 的列名:
colnames(all_tdm) <- c("chardonnay", "coffee")
最后,使用 as.matrix() 将对象转换为矩阵,以便在 comparison.cloud() 中使用。对于传入 comparison.cloud() 的每个独立语料库,您都可以指定颜色,例如 colors = c("red", "yellow", "green"),以便让各部分更易区分。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
all_corpus 已预加载到您的工作空间。
- 通过对
all_corpus应用预定义的clean_corpus函数创建all_clean。 - 从
all_clean创建一个TermDocumentMatrix,命名为all_tdm。 - 使用
colnames()重命名all_tdm中各自独立的语料库。将第一列命名为 "coffee",第二列命名为 "chardonnay"。 - 将
all_tdm转换为矩阵形式,创建all_m。 - 使用
all_m创建一个comparison.cloud(),并设置colors = c("orange", "blue")和max.words = 50。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Give the columns distinct names
___(___) <- ___
# Create all_m
___ <- ___(___)
# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)