开始使用免费开始使用

查找共同词

假设您想要可视化多份文档中出现的共同词。您可以使用 commonality.cloud() 来实现。

我们的 coffee 和 chardonnay 语料库各由许多独立的推文组成。为了将 coffee 的推文视为一个单一文档,chardonnay 也同理,您可以在每个语料库中将所有推文用 paste() 拼接起来,并传入参数 collapse = " "。这样会把所有推文(以空格分隔)折叠成一个字符向量。然后,您可以创建一个包含这两个折叠后文档的单一向量。

a_single_string <- paste(a_character_vector, collapse = " ")

完成以上步骤后,您可以像之前一样,从 all_tweets 对象的 VectorSource 出发,创建一个 VCorpus()

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • coffee_tweets$text 使用 paste() 并设置 collapse = " ",创建 all_coffee
  • chardonnay_tweets$text 使用 paste() 并设置 collapse = " ",创建 all_chardonnay
  • 使用 c()all_coffeeall_chardonnay 合并为 all_tweets,并将 all_coffee 放在第一个位置。
  • 使用 VectorSource() 转换 all_tweets
  • all_tweets 使用 VCorpus() 创建 all_corpus

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create all_coffee
___ <- ___(___, ___)

# Create all_chardonnay
___ <- ___(___, ___)

# Create all_tweets
___ <- ___(___, ___)

# Convert to a vector source
___ <- ___(___)

# Create all_corpus
___ <- ___(___)
编辑并运行代码