使用 qdap 找出高頻詞
如果你願意在前處理步驟上少一些手動控制,一個快速取得高頻詞的方法是使用 qdap 的 freq_terms()。
這個函式接受一個文字變數,在本例中是 tweets$text 向量。你可以用 top 參數指定要顯示的最高詞數,用 stopwords 參數提供要移除的停用詞向量,並用 at.least 參數設定要納入的詞彙最少字元數。qdap 有自己的一份停用詞清單,和 tm 的不同。這個練習會示範如何使用兩者,並比較其結果。
要將結果畫成基本圖形很簡單,只要對 freq_terms() 回傳的物件呼叫 plot() 即可。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create frequency
frequency <- ___(
___,
top = ___,
at.least = ___,
stopwords = ___
)
# Make a frequency bar chart