關於停用字的一切
在文字中,常會出現很頻繁但資訊量很低的詞,稱為「停用字」(stop words)。你通常會想把它們從分析中移除。常見的英文停用字包括「I」、「she'll」、「the」等。在 tm 套件中,內建有 174 個常見的英文停用字(你會在本練習中把它們列印出來!)。
進行分析時,你很可能需要把更多詞加入這個清單。在我們的咖啡推文範例裡,所有推文都包含「coffee」,因此除了常見的停用字外,把這個詞也移除就很重要。若保留「coffee」,不但沒有額外洞見,還會在詞頻分析中被過度強調。
使用 c() 函式可以把新詞加入停用字清單。例如,下面的程式會把「word1」和「word2」加入英文預設停用字清單:
all_stops <- c("word1", "word2", stopwords("en"))
當你整理出合宜的停用字清單後,就可以對文字使用 removeWords()。removeWords() 接受兩個引數:要處理的 text 物件,以及要移除的詞彙清單。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 呼叫
stopwords("en")檢視標準停用字。 - 從
text中移除「en」停用字。 - 將「coffee」與「bean」加入標準停用字,指定為
new_stops。 - 從
text中移除自訂的停用字new_stops。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
## text is preloaded into your workspace
# List standard English stop words
___
# Print text without standard stop words
removeWords(___, ___("___"))
# Add "coffee" and "bean" to the list: new_stops
new_stops <- c("___", "___", ___)
# Remove stop words from text
___