開始使用免費開始

特徵擷取與分析:amzn_cons

你現在決定用另一個雙字詞 TDM,將其與語料庫 amzn_cons_corp 對照。當然,你預期在文字雲中會看到一些不同的片語。

你會再次使用這個自訂函式,為視覺化擷取雙字詞特徵:

tokenizer <- function(x) 
  NGramTokenizer(x, Weka_control(min = 2, max = 2))

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

  • 建立 amzn_c_tdm:將 amzn_cons_corp 轉成 TermDocumentMatrix,並加入雙字詞函式 control = list(tokenize = tokenizer)
  • 建立 amzn_c_tdm_m:將 amzn_c_tdm 轉為矩陣。
  • 建立 amzn_c_freq:使用 rowSums()amzn_c_tdm_m 取得詞頻。
  • 建立一個 wordcloud(),使用 names(amzn_c_freq) 與其對應的值 amzn_c_freq。同時加入引數 max.words = 25color = "red"

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_c_tdm_m
___ <- ___

# Create amzn_c_freq
___ <- ___

# Plot a word cloud of negative Amazon bigrams
___
編輯並執行程式碼