探索 R 语料库
您的同事准备了一个包含 20 篇关于原油的文档的语料库,名为 crude。这只是您下周将收到的几千篇文章中的一个样本。为了准备对这些文档进行文本分析,您决定先探索其内容和元数据。请记住,在 R 中,VCorpus 对每篇文本同时包含 meta 和 content。在本练习中,您将探索这两个对象。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 打印
crude并查看输出。 - 打印第 10 篇文章的内容。
- 打印
crude中第 1 篇文章的 ID。 - 使用提供的 for 循环,从语料库中生成一个由各篇 ID 组成的向量。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Print out the corpus
print(___)
# Print the content of the 10th article
crude[[___]]$___
# Find the first ID
crude[[___]]$___$id
# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
ids <- append(ids, crude[[___]]$___$id)
}