始める無料で始める

テキスト前処理:ステミング

テキスト分析では、単語の語尾よりも語幹が重要になることがよくあります。たとえば『Animal Farm』は動物についての本ですが、animal's が248回、animal が107回出てくる、というだけでは分析に役立たないかもしれません。

tidy_animal_farm には、『Animal Farm』から取り出した単語をトークン化し、ストップワードを除いた tibble が入っています。次のステップとして、単語にステミングを施し、その結果を確認します。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • dplyrSnowballC を使って、tidy_animal_farm の単語にステミングを適用します。
  • tidy_animal_farm から元の単語頻度を出力します。
  • stemmed_animal_farm から新しい単語頻度を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Perform stemming on tidy_animal_farm
stemmed_animal_farm <- tidy_animal_farm %>%
  ___(word = ___(___))

# Print the old word frequencies 
___ %>%
  ___(word, sort = ___)

# Print the new word frequencies
___ %>%
  ___(word, sort = ___)
コードを編集して実行