開始使用免費開始

特徵擷取與分析:amzn_pros

amzn_pros_corpamzn_cons_corpgoog_pros_corpgoog_cons_corp 都已經過前處理,現在你可以擷取想要檢視的特徵。由於你採用 bag-of-words 方法,你決定為 Amazon 的正面評論語料庫 amzn_pros_corp 建立雙詞片語(bigram)的 TermDocumentMatrix。接著,你可以快速用 wordcloud() 來了解大家對在 Amazon 工作所連結的正面詞組。

以下函式使用 RWeka 將文字斷成兩詞片語,並在本練習的幕後被呼叫:

tokenizer <- function(x) {
  NGramTokenizer(x, Weka_control(min = 2, max = 2))
}

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

  • 建立 amzn_p_tdm:以 amzn_pros_corp 建立一個 TermDocumentMatrix。請加上 control = list(tokenize = tokenizer),讓詞彙以雙詞片語為單位。
  • 使用 as.matrix()amzn_p_tdm 轉為 amzn_p_tdm_m
  • 建立 amzn_p_freq,從 amzn_p_tdm_m 取得各詞的出現頻率。
  • 建立一個 wordcloud(),其中以 names(amzn_p_freq) 作為文字、amzn_p_freq 作為其頻率,並設定 max.words = 25color = "blue" 來美化視覺效果。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_tdm_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Plot a word cloud using amzn_p_freq values
___(___)
編輯並執行程式碼