开始使用免费开始使用

从数据框创建 VCorpus

如果您的文本数据在一个数据框中,您可以使用 DataframeSource() 来进行分析。传入 DataframeSource() 的数据框必须具有特定结构:

  • 第 1 列必须命名为 doc_id,且每一行都有唯一字符串。
  • 第 2 列必须命名为 text,并使用 "UTF-8" 编码(很常见)。
  • 其他任意列(第 3 列及之后)会被视为元数据,并以此形式保留。

本练习将介绍 meta(),用于提取与每个文档关联的元数据。您的数据通常会包含作者、日期、主题标签或地点等元数据,这些信息有助于分析。当文本被转换为语料库后,您可以使用 meta() 来查看这些额外的文档级信息。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

在您的工作区中,有一个名为 example_text 的简单数据框,包含正确的列名和一些元数据。还提供了用 VectorSource() 创建的易失性语料库 vec_corpus

  • 使用 example_text 调用 DataframeSource(),创建 df_source
  • 使用 VCorpus()df_source 转换为"易失性"语料库对象,创建 df_corpus
  • 打印 df_corpus。注意其包含的文档数量,以及保留的文档级元数据点数量。
  • df_corpus 使用 meta(),打印与文档相关的元数据。
  • 查看预加载的 vec_corpus 对象。将其"文档"数量与 df_corpus 比较。
  • vec_corpus 使用 meta(),比较 vec_corpusdf_corpus 之间的元数据差异。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a DataframeSource from the example text
df_source <- ___

# Convert df_source to a volatile corpus
df_corpus <- ___

# Examine df_corpus
df_corpus

# Examine df_corpus metadata
___

# Compare the number of documents in the vector source
vec_corpus

# Compare metadata in the vector corpus
___
编辑并运行代码