特徵擷取與分析:amzn_pros
amzn_pros_corp、amzn_cons_corp、goog_pros_corp 與 goog_cons_corp 都已經過前處理,現在你可以擷取想要檢視的特徵。由於你採用 bag-of-words 方法,你決定為 Amazon 的正面評論語料庫 amzn_pros_corp 建立雙詞片語(bigram)的 TermDocumentMatrix。接著,你可以快速用 wordcloud() 來了解大家對在 Amazon 工作所連結的正面詞組。
以下函式使用 RWeka 將文字斷成兩詞片語,並在本練習的幕後被呼叫:
tokenizer <- function(x) {
NGramTokenizer(x, Weka_control(min = 2, max = 2))
}
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 建立
amzn_p_tdm:以amzn_pros_corp建立一個TermDocumentMatrix。請加上control = list(tokenize = tokenizer),讓詞彙以雙詞片語為單位。 - 使用
as.matrix()將amzn_p_tdm轉為amzn_p_tdm_m。 - 建立
amzn_p_freq,從amzn_p_tdm_m取得各詞的出現頻率。 - 建立一個
wordcloud(),其中以names(amzn_p_freq)作為文字、amzn_p_freq作為其頻率,並設定max.words = 25與color = "blue"來美化視覺效果。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_tdm_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Plot a word cloud using amzn_p_freq values
___(___)