基于极性的语料创建
在本练习中,您将完成文本挖掘工作流的第 3 步。尽管 qdap 不是 tidy 风格的包,您仍将使用 mutate() 基于返回的 polarity 列表新增一列,表示"所有极性"(提示在此)得分。在第 3 章中我们使用了一个只基于基础 R 声明的自定义函数 pol_subsections。不过,为了遵循 tidy 原则,本练习将先用 filter(),再引入 pull()。pull() 与 [[ 类似,用于提取单个变量。
完成正负评论的分离后,您会将所有正面与负面评论分别合并为两个更大的文档,代表正面与负面房源评价中的所有词。
最后,您将创建一个基于词频–逆文档频率(TFIDF)的词-文档矩阵(TDM)。由于本练习从 tidy 结构开始,因此会结合使用从 tm 借来的部分函数与 %>% 运算符,以保持风格一致。如果您还不熟悉 tm 包的基础内容,请查看课程 Text Mining with Bag-of-Words in R。与简单统计词语出现次数(频率)不同,TDM 中的取值会对被过度使用的词进行惩罚,这有助于降低非信息性词语的影响。
本练习是课程的一部分
R 中的情感分析
交互式实操练习
通过完成这段示例代码来试试这个练习。
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")