开始使用免费开始使用

tm 中常见的清洗函数

现在您已经了解了创建语料库的两种方式,接下来把重点放在文本的清洗(或预处理)上。先从一小段文本开始清洗,然后再转向更大的语料库。

在基于词袋的文本挖掘中,清洗有助于合并术语。例如,把 "miner"、"mining" 和 "mine" 视为同一个词,往往更合理。具体的预处理步骤会因项目而异。例如,推文中使用的词与法律文书中的词差别很大,因此清洗流程也会明显不同。

常见的预处理函数包括:

  • tolower():将所有字符转换为小写
  • removePunctuation():移除所有标点符号
  • removeNumbers():移除数字
  • stripWhitespace():移除多余的空白

tolower() 属于 R 基础函数,其余三个函数来自 tm 包。接下来在需要时,我们会为您加载 tmqdap。每当引入一个新包,我们会在首次使用时让您手动加载。

脚本中已提供包含一句话的变量 text

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

将下列每个函数应用到 text,并将结果直接打印到控制台:

- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create the object: text
text <- "She woke up at       6 A.M. It\'s so early!  She was only 10% awake and began drinking coffee in front of her computer."

# Make lowercase
___

# Remove punctuation
____

# Remove numbers
___

# Remove whitespace
___
编辑并运行代码