始める無料で始める

単語の関連性

予想どおり、デンドログラム全体で似たようなトピックが見られました。ポジティブなコメントに戻り、ワードクラウドに現れた上位のフレーズを確認することにします。tmfindAssocs() 関数を使って、関連語を見つけたいと考えています。長時間労働やワークライフバランスの欠如を知った今、意外な発見がないか確かめましょう。

この演習はコースの一部です

Rで学ぶBag-of-Wordsによるテキストマイニング

コースを見る

演習の手順

amzn_pros_corp コーパスは、これまで同様にカスタム関数で前処理済みです。

  • amzn_pros_corpcontrol = list(tokenize = tokenizer) から、amzn_p_tdm という TDM を作成します。
  • amzn_p_tdm を行列に変換して amzn_p_m を作成します。
  • amzn_p_mrowSums() を適用して amzn_p_freq を作成します。
  • amzn_p_freqsort() を用い、引数 decreasing = TRUE を指定して term_frequency を作成します。
  • term_frequency[1:5] を使って、最初の 5 つのバイグラムを確認します。
  • 上位語として "fast paced" が出てくるのは意外かもしれません。これは "long hours" に関連するネガティブな意味合いを持つ可能性があるためです。"fast paced" と最も関連する語を確認しましょう。amzn_p_tdm に対して findAssocs() を使い、"fast paced"0.2 のカットオフで調べます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Create term_frequency
___ <- ___

# Print the 5 most common terms
___

# Find associations with fast-paced
___
コードを編集して実行