词干提取与词干还原入门
另一个常用的预处理步骤是进行"词干提取"和"词干还原"。词干提取会将词语归并为统一的词根,便于跨文档对齐。例如,"computational"、"computers" 和 "computation" 的词干都是 "comput"。但因为 "comput" 并不是一个真实单词,我们希望把它们还原成可识别的词语,使得 "computational"、"computers" 和 "computation" 都指向诸如 "computer" 这样的词。这个还原的步骤就叫做词干还原。
tm 包提供了 stemDocument() 函数用于获取词的词根。该函数可以接收字符向量并返回字符向量,或者接收 PlainTextDocument 并返回 PlainTextDocument。
例如,
stemDocument(c("computational", "computers", "computation"))
会返回 "comput" "comput" "comput"。
您将使用 stemCompletion() 将这些词根还原为已知词语。stemCompletion() 接受一个字符向量和一个补全词典。补全词典可以是字符向量或 Corpus 对象。无论哪种方式,在我们的示例中,补全词典需要包含单词 "computer",以便将所有 "comput" 的实例都还原。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 创建名为
complicate的向量,按顺序包含 "complicated"、"complication" 和 "complicatedly"。 - 将
complicate的词干版本保存到对象stem_doc中。 - 创建只包含一个单词 "complicate" 的
comp_dict。 - 使用
stemCompletion()作用于stem_doc,并以comp_dict作为参考语料,生成complete_text。 - 在控制台打印
complete_text。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create complicate
complicate <- ___
# Perform word stemming: stem_doc
stem_doc <- ___
# Create the completion dictionary: comp_dict
comp_dict <- ___
# Perform stem completion: complete_text
complete_text <- ___
# Print complete_text
complete_text