tm 中常见的清洗函数
现在您已经了解了创建语料库的两种方式,接下来把重点放在文本的清洗(或预处理)上。先从一小段文本开始清洗,然后再转向更大的语料库。
在基于词袋的文本挖掘中,清洗有助于合并术语。例如,把 "miner"、"mining" 和 "mine" 视为同一个词,往往更合理。具体的预处理步骤会因项目而异。例如,推文中使用的词与法律文书中的词差别很大,因此清洗流程也会明显不同。
常见的预处理函数包括:
tolower():将所有字符转换为小写removePunctuation():移除所有标点符号removeNumbers():移除数字stripWhitespace():移除多余的空白
tolower() 属于 R 基础函数,其余三个函数来自 tm 包。接下来在需要时,我们会为您加载 tm 和 qdap。每当引入一个新包,我们会在首次使用时让您手动加载。
脚本中已提供包含一句话的变量 text。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
将下列每个函数应用到 text,并将结果直接打印到控制台:
- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create the object: text
text <- "She woke up at 6 A.M. It\'s so early! She was only 10% awake and began drinking coffee in front of her computer."
# Make lowercase
___
# Remove punctuation
____
# Remove numbers
___
# Remove whitespace
___