从语料库创建 tibble
为了进一步探索您从同事处获得的原油数据语料库,您决定构建一条管道来清洗文档中的文本。与其使用 tm 包来完成,您选择将语料库转换为 tibble,这样就可以使用您已经熟悉的 unnest_tokens()、count() 和 anti_join() 函数。语料库 crude 同时包含每篇文档的元数据和正文文本。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 将语料库转换为 tibble。
- 使用
names打印列名。 - 对
crude_tibble的text列按词进行分词、计数,并移除停用词。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)