开始使用免费开始使用

基于极性的语料创建

在本练习中,您将完成文本挖掘工作流的第 3 步。尽管 qdap 不是 tidy 风格的包,您仍将使用 mutate() 基于返回的 polarity 列表新增一列,表示"所有极性"(提示在此)得分。在第 3 章中我们使用了一个只基于基础 R 声明的自定义函数 pol_subsections。不过,为了遵循 tidy 原则,本练习将先用 filter(),再引入 pull()pull()[[ 类似,用于提取单个变量。

完成正负评论的分离后,您会将所有正面与负面评论分别合并为两个更大的文档,代表正面与负面房源评价中的所有词。

最后,您将创建一个基于词频–逆文档频率(TFIDF)的词-文档矩阵(TDM)。由于本练习从 tidy 结构开始,因此会结合使用从 tm 借来的部分函数与 %>% 运算符,以保持风格一致。如果您还不熟悉 tm 包的基础内容,请查看课程 Text Mining with Bag-of-Words in R。与简单统计词语出现次数(频率)不同,TDM 中的取值会对被过度使用的词进行惩罚,这有助于降低非信息性词语的影响。

本练习是课程的一部分

R 中的情感分析

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
编辑并运行代码