共通する単語を可視化する
chardonnay と coffee のツイートファイルで共通して使われている単語が入ったコーパスが用意できたので、まずコーパスをクリーンアップし、TermDocumentMatrix に変換し、その後に commonality.cloud() に備えて行列に変換します。
commonality.cloud() 関数は、この行列オブジェクトに加えて、プロットをカスタマイズするための max.words や colors などの追加引数を受け取ります。
commonality.cloud(tdm_matrix, max.words = 100, colors = "springgreen")
この演習はコースの一部です
Rで学ぶBag-of-Wordsによるテキストマイニング
演習の手順
- 事前定義された
clean_corpus()関数をall_corpusに適用して、all_cleanを作成します。 all_cleanからTermDocumentMatrixのall_tdmを作成します。all_tdmを行列オブジェクトに変換してall_mを作成します。all_mを使って、max.words = 100、colors = "steelblue1"を指定したcommonality.cloud()を作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Create all_m
___ <- ___(___)
# Print a commonality cloud
___(___, ___, ___)