スパース行列
このレッスンでは、スパース行列について学びました。テキスト文書の数やユニークな単語数が増えると、スパース行列は計算量の観点で大きな負担になります。絵文字、スラング、頭字語など多様な表現が使われるため、ツイートで単語表現を作るとスパース行列になりやすいです。
この演習では、ロシア語ツイートのデータセットがどれくらいスパースかを計算する手順を体験します。これは、テキスト分析がどれほど素早く大きな計算問題になり得るかを示す小さな例です。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)