特徴抽出と分析:amzn_cons
今度は、amzn_cons_corp コーパスを使って、別のバイグラム TDM と比較してみます。もちろん、ワードクラウドには異なるフレーズがいくつか現れるはずです。
もう一度、以下のカスタム関数を使って、可視化用のバイグラム特徴量を抽出します。
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
この演習はコースの一部です
Rで学ぶBag-of-Wordsによるテキストマイニング
演習の手順
amzn_cons_corpをTermDocumentMatrixに変換し、バイグラム関数control = list(tokenize = tokenizer)を組み込んで、amzn_c_tdmを作成します。amzn_c_tdmを行列に変換して、amzn_c_tdm_mを作成します。rowSums()を使ってamzn_c_tdm_mから用語頻度を取得し、amzn_c_freqを作成します。names(amzn_c_freq)と値amzn_c_freqを用いてwordcloud()を作成します。引数max.words = 25とcolor = "red"も指定してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___