开始使用免费开始使用

探索 R 语料库

您的同事准备了一个包含 20 篇关于原油的文档的语料库,名为 crude。这只是您下周将收到的几千篇文章中的一个样本。为了准备对这些文档进行文本分析,您决定先探索其内容和元数据。请记住,在 R 中,VCorpus 对每篇文本同时包含 metacontent。在本练习中,您将探索这两个对象。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 打印 crude 并查看输出。
  • 打印第 10 篇文章的内容。
  • 打印 crude 中第 1 篇文章的 ID。
  • 使用提供的 for 循环,从语料库中生成一个由各篇 ID 组成的向量。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Print out the corpus
print(___)

# Print the content of the 10th article
crude[[___]]$___

# Find the first ID
crude[[___]]$___$id

# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
  ids <- append(ids, crude[[___]]$___$id)
}
编辑并运行代码