开始使用免费开始使用

词干提取与词干还原入门

另一个常用的预处理步骤是进行"词干提取"和"词干还原"。词干提取会将词语归并为统一的词根,便于跨文档对齐。例如,"computational"、"computers" 和 "computation" 的词干都是 "comput"。但因为 "comput" 并不是一个真实单词,我们希望把它们还原成可识别的词语,使得 "computational"、"computers" 和 "computation" 都指向诸如 "computer" 这样的词。这个还原的步骤就叫做词干还原。

tm 包提供了 stemDocument() 函数用于获取词的词根。该函数可以接收字符向量并返回字符向量,或者接收 PlainTextDocument 并返回 PlainTextDocument

例如,

stemDocument(c("computational", "computers", "computation"))

会返回 "comput" "comput" "comput"

您将使用 stemCompletion() 将这些词根还原为已知词语。stemCompletion() 接受一个字符向量和一个补全词典。补全词典可以是字符向量或 Corpus 对象。无论哪种方式,在我们的示例中,补全词典需要包含单词 "computer",以便将所有 "comput" 的实例都还原。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • 创建名为 complicate 的向量,按顺序包含 "complicated"、"complication" 和 "complicatedly"。
  • complicate 的词干版本保存到对象 stem_doc 中。
  • 创建只包含一个单词 "complicate" 的 comp_dict
  • 使用 stemCompletion() 作用于 stem_doc,并以 comp_dict 作为参考语料,生成 complete_text
  • 在控制台打印 complete_text

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create complicate
complicate <- ___

# Perform word stemming: stem_doc
stem_doc <- ___

# Create the completion dictionary: comp_dict
comp_dict <- ___

# Perform stem completion: complete_text 
complete_text <- ___

# Print complete_text
complete_text
编辑并运行代码