将向量转换为 VCorpus 对象(1)
回想一下,上一道练习中您已将文本数据加载为名为 coffee_tweets 的向量。下一步需要把这个包含文本数据的向量转换为一个语料库(corpus)。正如您在视频中所学,语料库是文档的集合;同时也需要知道,在 tm 领域中,R 将其识别为一种数据类型。
语料库数据类型有两种:永久语料库 PCorpus 和易失语料库 VCorpus。本质上的区别在于文档集合在您电脑中的存储方式。在本课程中,我们将使用易失语料库。它保存在您电脑的 RAM 中,而不是写入磁盘,这样可以更高效地利用内存。
为了创建一个易失语料库,R 需要把文本向量 coffee_tweets 的每个元素都当作一篇文档。tm 包提供了称为 Source 的函数来完成这件事!在本练习中,由于我们的文本数据存放在向量中,将使用名为 VectorSource() 的 Source 函数。该函数的输出称为 Source 对象。请试一试!
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 加载
tm包。 - 从
coffee_tweets向量创建一个 Source 对象,并将其命名为coffee_source。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load tm
___
# Make a vector source from coffee_tweets
___