単語の関連性
予想どおり、デンドログラム全体で似たようなトピックが見られました。ポジティブなコメントに戻り、ワードクラウドに現れた上位のフレーズを確認することにします。tm の findAssocs() 関数を使って、関連語を見つけたいと考えています。長時間労働やワークライフバランスの欠如を知った今、意外な発見がないか確かめましょう。
この演習はコースの一部です
Rで学ぶBag-of-Wordsによるテキストマイニング
演習の手順
amzn_pros_corp コーパスは、これまで同様にカスタム関数で前処理済みです。
amzn_pros_corpとcontrol = list(tokenize = tokenizer)から、amzn_p_tdmという TDM を作成します。amzn_p_tdmを行列に変換してamzn_p_mを作成します。amzn_p_mにrowSums()を適用してamzn_p_freqを作成します。amzn_p_freqにsort()を用い、引数decreasing = TRUEを指定してterm_frequencyを作成します。term_frequency[1:5]を使って、最初の 5 つのバイグラムを確認します。- 上位語として "fast paced" が出てくるのは意外かもしれません。これは "long hours" に関連するネガティブな意味合いを持つ可能性があるためです。"fast paced" と最も関連する語を確認しましょう。
amzn_p_tdmに対してfindAssocs()を使い、"fast paced"を0.2のカットオフで調べます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___