tm 的常見清理函式
既然你已經知道兩種建立語料庫的方法,接下來就把重點放在清理(或稱前處理)文字上。你會先清理由一小段文字開始,然後再處理較大的語料庫。
在 bag of words 的文字探勘中,清理可以幫助彙整詞彙。例如,將「miner」、「mining」與「mine」視為同一個詞,通常是合理的。具體的前處理步驟會隨專案而異。舉例來說,推文中使用的詞和法律文件裡的詞差異很大,因此清理流程也可能非常不同。
常見的前處理函式包括:
tolower(): 將所有字元轉成小寫removePunctuation(): 移除所有標點符號removeNumbers(): 移除數字stripWhitespace(): 移除多餘的空白
tolower() 屬於 R 基礎功能,而另外三個函式來自 tm 套件。之後在需要時,我們會為你載入 tm 與 qdap。每次引入新的套件時,會先讓你自行載入一次。
變數 text(包含一句話)已在指令碼中提供。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
將下列每個函式套用到 text,並直接把結果印在主控台:
- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create the object: text
text <- "She woke up at 6 A.M. It\'s so early! She was only 10% awake and began drinking coffee in front of her computer."
# Make lowercase
___
# Remove punctuation
____
# Remove numbers
___
# Remove whitespace
___