始める無料で始める

共通する単語を可視化する

chardonnay と coffee のツイートファイルで共通して使われている単語が入ったコーパスが用意できたので、まずコーパスをクリーンアップし、TermDocumentMatrix に変換し、その後に commonality.cloud() に備えて行列に変換します。

commonality.cloud() 関数は、この行列オブジェクトに加えて、プロットをカスタマイズするための max.wordscolors などの追加引数を受け取ります。

commonality.cloud(tdm_matrix, max.words = 100, colors = "springgreen")

この演習はコースの一部です

Rで学ぶBag-of-Wordsによるテキストマイニング

コースを見る

演習の手順

  • 事前定義された clean_corpus() 関数を all_corpus に適用して、all_clean を作成します。
  • all_clean から TermDocumentMatrixall_tdm を作成します。
  • all_tdm を行列オブジェクトに変換して all_m を作成します。
  • all_m を使って、max.words = 100colors = "steelblue1" を指定した commonality.cloud() を作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Clean the corpus
___ <- ___(___)

# Create all_tdm
___ <- ___(___)

# Create all_m
___ <- ___(___)

# Print a commonality cloud
___(___, ___, ___)
コードを編集して実行