始める無料で始める

amzn_cons 樹形図

レビューから、長時間労働やワークライフバランスの悪さが強く示唆されているようです。簡単なクラスタリング手法として、階層的クラスタリングを実行し、これらのフレーズのつながりを確認するために樹形図を作成しましょう。

この演習はコースの一部です

Rで学ぶBag-of-Wordsによるテキストマイニング

コースを見る

演習の手順

  • amzn_cons_corp を使い、control = list(tokenize = tokenizer) を指定して、TermDocumentMatrix として amzn_c_tdm を作成します。
  • amzn_c_tdm をコンソールに出力します。
  • removeSparseTerms() 関数を amzn_c_tdm に適用し、sparse 引数を .993 にして amzn_c_tdm2 を作成します。
  • 距離行列 dist(amzn_c_tdm2)hclust() 関数の中に入れ子にして、階層的クラスタオブジェクト hc を作成します。あわせて hclust() 関数に method = "complete" も渡してください。
  • hc をプロットし、クラスタ化されたバイグラムを確認して、Amazon の cons セクションにある概念がどのように結論につながるかを見てみましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Print amzn_c_tdm to the console
___

# Create amzn_c_tdm2 by removing sparse terms 
___ <- ___

# Create hc as a cluster of distance values
___ <- ___(___,
           ___)

# Produce a plot of hc
___
コードを編集して実行