开始使用免费开始使用

从语料库创建 tibble

为了进一步探索您从同事处获得的原油数据语料库,您决定构建一条管道来清洗文档中的文本。与其使用 tm 包来完成,您选择将语料库转换为 tibble,这样就可以使用您已经熟悉的 unnest_tokens()count()anti_join() 函数。语料库 crude 同时包含每篇文档的元数据和正文文本。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 将语料库转换为 tibble。
  • 使用 names 打印列名。
  • crude_tibbletext 列按词进行分词、计数,并移除停用词。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
编辑并运行代码