查找共同词
假设您想要可视化多份文档中出现的共同词。您可以使用 commonality.cloud() 来实现。
我们的 coffee 和 chardonnay 语料库各由许多独立的推文组成。为了将 coffee 的推文视为一个单一文档,chardonnay 也同理,您可以在每个语料库中将所有推文用 paste() 拼接起来,并传入参数 collapse = " "。这样会把所有推文(以空格分隔)折叠成一个字符向量。然后,您可以创建一个包含这两个折叠后文档的单一向量。
a_single_string <- paste(a_character_vector, collapse = " ")
完成以上步骤后,您可以像之前一样,从 all_tweets 对象的 VectorSource 出发,创建一个 VCorpus()。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 对
coffee_tweets$text使用paste()并设置collapse = " ",创建all_coffee。 - 对
chardonnay_tweets$text使用paste()并设置collapse = " ",创建all_chardonnay。 - 使用
c()将all_coffee和all_chardonnay合并为all_tweets,并将all_coffee放在第一个位置。 - 使用
VectorSource()转换all_tweets。 - 对
all_tweets使用VCorpus()创建all_corpus。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create all_coffee
___ <- ___(___, ___)
# Create all_chardonnay
___ <- ___(___, ___)
# Create all_tweets
___ <- ___(___, ___)
# Convert to a vector source
___ <- ___(___)
# Create all_corpus
___ <- ___(___)