開始使用免費開始

使用 qdap 找出高頻詞

如果你願意在前處理步驟上少一些手動控制,一個快速取得高頻詞的方法是使用 qdapfreq_terms()

這個函式接受一個文字變數,在本例中是 tweets$text 向量。你可以用 top 參數指定要顯示的最高詞數,用 stopwords 參數提供要移除的停用詞向量,並用 at.least 參數設定要納入的詞彙最少字元數。qdap 有自己的一份停用詞清單,和 tm 的不同。這個練習會示範如何使用兩者,並比較其結果。

要將結果畫成基本圖形很簡單,只要對 freq_terms() 回傳的物件呼叫 plot() 即可。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create frequency
frequency <- ___(
  ___, 
  top = ___, 
  at.least = ___, 
  stopwords = ___
)

# Make a frequency bar chart
編輯並執行程式碼