开始使用免费开始使用

稀疏矩阵

在视频课程中,您学习了稀疏矩阵。随着文本文档数量和唯一词汇数量的增加,稀疏矩阵会迅速成为计算噩梦。用推文创建词表示时很容易产生稀疏矩阵,因为其中包含表情符号、俚语、缩写以及其他语言形式。

在本练习中,您将依次完成各步骤,计算俄语推文数据集的稀疏程度。请注意,这个小示例将展示文本分析如何很快演变成一个重大的计算问题。

本练习是课程的一部分

R 自然语言处理入门

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
  ___(word, content) %>%
  ___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
  count(___)
编辑并运行代码