始める無料で始める

ストップワードと余分なスペースを削除する

テキストのコーパスには、通常「a」「an」「the」「of」「but」などの一般的な語が多く含まれます。自然言語処理では、これらをストップワードと呼びます。

ストップワードは、コーパス内のより重要な語に注目して洞察を得られるよう、前処理の段階で通常は削除します。

また、記号、句読点、数字、ストップワードを削除した際に生じる余分なスペースも、コーパスから取り除く必要があります。

前の演習で作成したコーパスは twt_corpus_lwr として読み込まれています。

この演習ではライブラリ tm が読み込まれています。

この演習はコースの一部です

Rで学ぶソーシャルメディアデータ分析

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Remove English stop words from the corpus and view the corpus 
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)
コードを編集して実行