開始使用免費開始

tm 的常見清理函式

既然你已經知道兩種建立語料庫的方法,接下來就把重點放在清理(或稱前處理)文字上。你會先清理由一小段文字開始,然後再處理較大的語料庫。

在 bag of words 的文字探勘中,清理可以幫助彙整詞彙。例如,將「miner」、「mining」與「mine」視為同一個詞,通常是合理的。具體的前處理步驟會隨專案而異。舉例來說,推文中使用的詞和法律文件裡的詞差異很大,因此清理流程也可能非常不同。

常見的前處理函式包括:

  • tolower(): 將所有字元轉成小寫
  • removePunctuation(): 移除所有標點符號
  • removeNumbers(): 移除數字
  • stripWhitespace(): 移除多餘的空白

tolower() 屬於 R 基礎功能,而另外三個函式來自 tm 套件。之後在需要時,我們會為你載入 tmqdap。每次引入新的套件時,會先讓你自行載入一次。

變數 text(包含一句話)已在指令碼中提供。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

將下列每個函式套用到 text,並直接把結果印在主控台:

- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create the object: text
text <- "She woke up at       6 A.M. It\'s so early!  She was only 10% awake and began drinking coffee in front of her computer."

# Make lowercase
___

# Remove punctuation
____

# Remove numbers
___

# Remove whitespace
___
編輯並執行程式碼