稀疏矩陣
在影片課程中你學到了稀疏矩陣。當文字文件的數量和不重複字詞的數量成長時,稀疏矩陣很快就會變成計算上的惡夢。用推文來建立文字表示時很容易出現稀疏矩陣,因為其中會使用表情符號、俚語、縮寫,以及其他各種語言形式。
在這個練習中,你會一步一步計算俄文推文資料集的稀疏程度。請注意,這個小例子說明文字分析多麼容易就會變成重大的運算問題。
本練習屬於課程
R 的自然語言處理入門
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)