特徵擷取與分析:amzn_cons
你現在決定用另一個雙字詞 TDM,將其與語料庫 amzn_cons_corp 對照。當然,你預期在文字雲中會看到一些不同的片語。
你會再次使用這個自訂函式,為視覺化擷取雙字詞特徵:
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 建立
amzn_c_tdm:將amzn_cons_corp轉成TermDocumentMatrix,並加入雙字詞函式control = list(tokenize = tokenizer)。 - 建立
amzn_c_tdm_m:將amzn_c_tdm轉為矩陣。 - 建立
amzn_c_freq:使用rowSums()從amzn_c_tdm_m取得詞頻。 - 建立一個
wordcloud(),使用names(amzn_c_freq)與其對應的值amzn_c_freq。同時加入引數max.words = 25與color = "red"。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___