テキスト前処理:ステミング
テキスト分析では、単語の語尾よりも語幹が重要になることがよくあります。たとえば『Animal Farm』は動物についての本ですが、animal's が248回、animal が107回出てくる、というだけでは分析に役立たないかもしれません。
tidy_animal_farm には、『Animal Farm』から取り出した単語をトークン化し、ストップワードを除いた tibble が入っています。次のステップとして、単語にステミングを施し、その結果を確認します。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
dplyrとSnowballCを使って、tidy_animal_farmの単語にステミングを適用します。tidy_animal_farmから元の単語頻度を出力します。stemmed_animal_farmから新しい単語頻度を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Perform stemming on tidy_animal_farm
stemmed_animal_farm <- tidy_animal_farm %>%
___(word = ___(___))
# Print the old word frequencies
___ %>%
___(word, sort = ___)
# Print the new word frequencies
___ %>%
___(word, sort = ___)