特徴抽出と分析: amzn_pros
amzn_pros_corp、amzn_cons_corp、goog_pros_corp、goog_cons_corp はすべて前処理済みです。ここから、調べたい特徴量を抽出していきます。今回は bag of words アプローチを使うので、Amazon のポジティブなレビューコーパス amzn_pros_corp から、バイグラムの TermDocumentMatrix を作成します。これにより、wordcloud() をすばやく作って、Amazon で働くことに人々が前向きに関連づける語句を把握できます。
以下の関数は RWeka を使って 2 語のトークン化を行い、この演習の裏側で利用されます。
tokenizer <- function(x) {
NGramTokenizer(x, Weka_control(min = 2, max = 2))
}
この演習はコースの一部です
Rで学ぶBag-of-Wordsによるテキストマイニング
演習の手順
amzn_pros_corpからTermDocumentMatrixを作成し、amzn_p_tdmとして保存します。語をバイグラムにするため、control = list(tokenize = tokenizer)を必ず指定します。as.matrix()関数を使って、amzn_p_tdmからamzn_p_tdm_mを作成します。amzn_p_tdm_mから用語頻度を取得し、amzn_p_freqを作成します。wordcloud()を作成します。語にはnames(amzn_p_freq)を、頻度にはamzn_p_freqを使い、見た目の指定としてmax.words = 25とcolor = "blue"を設定します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_tdm_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Plot a word cloud using amzn_p_freq values
___(___)