开始使用免费开始使用

将向量转换为 VCorpus 对象(1)

回想一下,上一道练习中您已将文本数据加载为名为 coffee_tweets 的向量。下一步需要把这个包含文本数据的向量转换为一个语料库(corpus)。正如您在视频中所学,语料库是文档的集合;同时也需要知道,在 tm 领域中,R 将其识别为一种数据类型。

语料库数据类型有两种:永久语料库 PCorpus 和易失语料库 VCorpus。本质上的区别在于文档集合在您电脑中的存储方式。在本课程中,我们将使用易失语料库。它保存在您电脑的 RAM 中,而不是写入磁盘,这样可以更高效地利用内存。

为了创建一个易失语料库,R 需要把文本向量 coffee_tweets 的每个元素都当作一篇文档。tm 包提供了称为 Source 的函数来完成这件事!在本练习中,由于我们的文本数据存放在向量中,将使用名为 VectorSource() 的 Source 函数。该函数的输出称为 Source 对象。请试一试!

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • 加载 tm 包。
  • coffee_tweets 向量创建一个 Source 对象,并将其命名为 coffee_source

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load tm
___

# Make a vector source from coffee_tweets
___
编辑并运行代码