开始使用免费开始使用

数据准备

在 2016 年美国大选期间,俄罗斯的推文机器人不断向民主党和共和党的受众传播政治言论。您拿到了一份此类推文的数据集,名为 russian_tweets。您打算将这些推文分类为左倾(民主党)或右倾(共和党)。在构建分类模型之前,您需要先清洗并准备文本用于建模。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 通过对标记进行词干提取来完成分词流程。
  • 使用 cast_dtm() 创建文档-词项矩阵。
  • 使用 tf-idf 加权文档-词项矩阵。
  • 打印该矩阵。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
编辑并运行代码