开始使用免费开始使用

在 tm 中捕获元数据

根据您的目标,创建语料库时可能需要保留文档的元数据。

要捕获文档级元数据,列名和顺序必须为:

  1. doc_id —— 每个文档的唯一字符串
  2. text —— 要分析的文本
  3. ... —— 其他任意列都会被自动归档为元数据。

有时您需要重命名列以符合 DataframeSource() 的要求。names() 函数对此很有帮助。

tweets 已存在于您的工作空间中,是一个数据框,包含列 "num"、"text"、"screenName" 和 "created"。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • tweets 的第 1 列重命名为 "doc_id"。
  • 在较小的 tweets 数据框上使用 DataframeSource() 设置文档模式。
  • 将文档集合做成可挥发语料库,并嵌套在自定义的 clean_corpus() 函数中。
  • 对第 1 条推文使用 content()中括号(如 text_corpus[[1]])以查看清洗后的纯文本。
  • 使用中括号对第 1 个文档调用 meta() 函数,确认所有元数据都被捕获。

请记住,访问语料库的部分内容时,中括号和中括号是有区别的!在本练习中,content() 使用双中括号,meta() 使用单中括号。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Rename columns
___(tweets)[1] <- "___"

# Set the schema: docs
docs <- ___(___)

# Make a clean volatile corpus: text_corpus
text_corpus <- clean_corpus(___(___))

# Examine the first doc content
___(text_corpus[[___]])

# Access the first doc metadata
___(text_corpus[___])
编辑并运行代码