ストップワードと余分なスペースを削除する
テキストのコーパスには、通常「a」「an」「the」「of」「but」などの一般的な語が多く含まれます。自然言語処理では、これらをストップワードと呼びます。
ストップワードは、コーパス内のより重要な語に注目して洞察を得られるよう、前処理の段階で通常は削除します。
また、記号、句読点、数字、ストップワードを削除した際に生じる余分なスペースも、コーパスから取り除く必要があります。
前の演習で作成したコーパスは twt_corpus_lwr として読み込まれています。
この演習ではライブラリ tm が読み込まれています。
この演習はコースの一部です
Rで学ぶソーシャルメディアデータ分析
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)