数据准备
在 2016 年美国大选期间,俄罗斯的推文机器人不断向民主党和共和党的受众传播政治言论。您拿到了一份此类推文的数据集,名为 russian_tweets。您打算将这些推文分类为左倾(民主党)或右倾(共和党)。在构建分类模型之前,您需要先清洗并准备文本用于建模。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 通过对标记进行词干提取来完成分词流程。
- 使用
cast_dtm()创建文档-词项矩阵。 - 使用 tf-idf 加权文档-词项矩阵。
- 打印该矩阵。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Stem the tokens
russian_tokens <- russian_tweets %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words) %>%
___(word = ___(word))
# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
count(tweet_id, word) %>%
___(document = ___, term = ___,
value = n, weighting = tm::___)
# Print the matrix details
___