開始使用免費開始

稀疏矩陣

在影片課程中你學到了稀疏矩陣。當文字文件的數量和不重複字詞的數量成長時,稀疏矩陣很快就會變成計算上的惡夢。用推文來建立文字表示時很容易出現稀疏矩陣,因為其中會使用表情符號、俚語、縮寫,以及其他各種語言形式。

在這個練習中,你會一步一步計算俄文推文資料集的稀疏程度。請注意,這個小例子說明文字分析多麼容易就會變成重大的運算問題。

本練習屬於課程

R 的自然語言處理入門

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
  ___(word, content) %>%
  ___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
  count(___)
編輯並執行程式碼