共通でない単語を可視化する
共通していない単語を可視化したいとします。そのためには comparison.cloud() も使えます。手順はほぼ同じですが、1 つ大きな違いがあります。
共通する単語を探したときと同様に、まずツイートを別々のコーパスにまとめ、それらを VCorpus() オブジェクトに結合します。次に clean_corpus() 関数を適用し、TermDocumentMatrix に整理します。
coffee と chardonnay のどちらに属する単語かを区別できるように、TDM の列名は次のように設定できます。
colnames(all_tdm) <- c("chardonnay", "coffee")
最後に、comparison.cloud() で使えるように、as.matrix() を使ってオブジェクトを行列に変換します。comparison.cloud() に渡す各コーパスごとに色を指定できます(例: colors = c("red", "yellow", "green"))。セクションを見分けやすくするためです。
この演習はコースの一部です
Rで学ぶBag-of-Wordsによるテキストマイニング
演習の手順
all_corpus はワークスペースにプリロードされています。
- 事前定義された
clean_corpus関数をall_corpusに適用して、all_cleanを作成します。 all_cleanからTermDocumentMatrixのall_tdmを作成します。colnames()を使って、all_tdm内の各コーパスの列名を変更します。1 列目を "coffee"、2 列目を "chardonnay" にしてください。all_tdmを行列形式に変換してall_mを作成します。all_mを使ってcomparison.cloud()を作成し、colors = c("orange", "blue")とmax.words = 50を指定します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Give the columns distinct names
___(___) <- ___
# Create all_m
___ <- ___(___)
# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)