从数据框创建 VCorpus
如果您的文本数据在一个数据框中,您可以使用 DataframeSource() 来进行分析。传入 DataframeSource() 的数据框必须具有特定结构:
- 第 1 列必须命名为
doc_id,且每一行都有唯一字符串。 - 第 2 列必须命名为
text,并使用 "UTF-8" 编码(很常见)。 - 其他任意列(第 3 列及之后)会被视为元数据,并以此形式保留。
本练习将介绍 meta(),用于提取与每个文档关联的元数据。您的数据通常会包含作者、日期、主题标签或地点等元数据,这些信息有助于分析。当文本被转换为语料库后,您可以使用 meta() 来查看这些额外的文档级信息。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
在您的工作区中,有一个名为 example_text 的简单数据框,包含正确的列名和一些元数据。还提供了用 VectorSource() 创建的易失性语料库 vec_corpus。
- 使用
example_text调用DataframeSource(),创建df_source。 - 使用
VCorpus()将df_source转换为"易失性"语料库对象,创建df_corpus。 - 打印
df_corpus。注意其包含的文档数量,以及保留的文档级元数据点数量。 - 对
df_corpus使用meta(),打印与文档相关的元数据。 - 查看预加载的
vec_corpus对象。将其"文档"数量与df_corpus比较。 - 对
vec_corpus使用meta(),比较vec_corpus与df_corpus之间的元数据差异。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a DataframeSource from the example text
df_source <- ___
# Convert df_source to a volatile corpus
df_corpus <- ___
# Examine df_corpus
df_corpus
# Examine df_corpus metadata
___
# Compare the number of documents in the vector source
vec_corpus
# Compare metadata in the vector corpus
___