開始使用免費開始

關於停用字的一切

在文字中,常會出現很頻繁但資訊量很低的詞,稱為「停用字」(stop words)。你通常會想把它們從分析中移除。常見的英文停用字包括「I」、「she'll」、「the」等。在 tm 套件中,內建有 174 個常見的英文停用字(你會在本練習中把它們列印出來!)。

進行分析時,你很可能需要把更多詞加入這個清單。在我們的咖啡推文範例裡,所有推文都包含「coffee」,因此除了常見的停用字外,把這個詞也移除就很重要。若保留「coffee」,不但沒有額外洞見,還會在詞頻分析中被過度強調。

使用 c() 函式可以把新詞加入停用字清單。例如,下面的程式會把「word1」和「word2」加入英文預設停用字清單:

all_stops <- c("word1", "word2", stopwords("en"))

當你整理出合宜的停用字清單後,就可以對文字使用 removeWords()removeWords() 接受兩個引數:要處理的 text 物件,以及要移除的詞彙清單。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

  • 呼叫 stopwords("en") 檢視標準停用字。
  • text 中移除「en」停用字。
  • 將「coffee」與「bean」加入標準停用字,指定為 new_stops
  • text 中移除自訂的停用字 new_stops

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

## text is preloaded into your workspace

# List standard English stop words
___

# Print text without standard stop words
removeWords(___, ___("___"))

# Add "coffee" and "bean" to the list: new_stops
new_stops <- c("___", "___", ___)

# Remove stop words from text
___
編輯並執行程式碼