在 tm 中捕获元数据
根据您的目标,创建语料库时可能需要保留文档的元数据。
要捕获文档级元数据,列名和顺序必须为:
doc_id—— 每个文档的唯一字符串text—— 要分析的文本...—— 其他任意列都会被自动归档为元数据。
有时您需要重命名列以符合 DataframeSource() 的要求。names() 函数对此很有帮助。
tweets 已存在于您的工作空间中,是一个数据框,包含列 "num"、"text"、"screenName" 和 "created"。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 将
tweets的第 1 列重命名为 "doc_id"。 - 在较小的
tweets数据框上使用DataframeSource()设置文档模式。 - 将文档集合做成可挥发语料库,并嵌套在自定义的
clean_corpus()函数中。 - 对第 1 条推文使用
content()和双中括号(如text_corpus[[1]])以查看清洗后的纯文本。 - 使用单中括号对第 1 个文档调用
meta()函数,确认所有元数据都被捕获。
请记住,访问语料库的部分内容时,双中括号和单中括号是有区别的!在本练习中,content() 使用双中括号,meta() 使用单中括号。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Rename columns
___(tweets)[1] <- "___"
# Set the schema: docs
docs <- ___(___)
# Make a clean volatile corpus: text_corpus
text_corpus <- clean_corpus(___(___))
# Examine the first doc content
___(text_corpus[[___]])
# Access the first doc metadata
___(text_corpus[___])