amzn_cons 樹形図
レビューから、長時間労働やワークライフバランスの悪さが強く示唆されているようです。簡単なクラスタリング手法として、階層的クラスタリングを実行し、これらのフレーズのつながりを確認するために樹形図を作成しましょう。
この演習はコースの一部です
Rで学ぶBag-of-Wordsによるテキストマイニング
演習の手順
amzn_cons_corpを使い、control = list(tokenize = tokenizer)を指定して、TermDocumentMatrixとしてamzn_c_tdmを作成します。amzn_c_tdmをコンソールに出力します。removeSparseTerms()関数をamzn_c_tdmに適用し、sparse引数を.993にしてamzn_c_tdm2を作成します。- 距離行列
dist(amzn_c_tdm2)をhclust()関数の中に入れ子にして、階層的クラスタオブジェクトhcを作成します。あわせてhclust()関数にmethod = "complete"も渡してください。 hcをプロットし、クラスタ化されたバイグラムを確認して、Amazon の cons セクションにある概念がどのように結論につながるかを見てみましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Print amzn_c_tdm to the console
___
# Create amzn_c_tdm2 by removing sparse terms
___ <- ___
# Create hc as a cluster of distance values
___ <- ___(___,
___)
# Produce a plot of hc
___