稀疏矩阵
在视频课程中,您学习了稀疏矩阵。随着文本文档数量和唯一词汇数量的增加,稀疏矩阵会迅速成为计算噩梦。用推文创建词表示时很容易产生稀疏矩阵,因为其中包含表情符号、俚语、缩写以及其他语言形式。
在本练习中,您将依次完成各步骤,计算俄语推文数据集的稀疏程度。请注意,这个小示例将展示文本分析如何很快演变成一个重大的计算问题。
本练习是课程的一部分
R 自然语言处理入门
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)