在真实文本上计算极性
到目前为止,您已经了解了判断文本中正向或负向意图所需的基本要素。请记住以下要点,您就能对结果更有信心。
- 主观性词典 是预先定义的词表,收录与情绪或正负感受相关的词。
- 您不必在主观性词典中罗列每一个词,因为 Zipf 定律 描述了人类语言的用词分布。
一个快速入门的方法是使用带有内置主观性词典的 polarity() 函数。
该函数会扫描文本以识别出现在词典中的词。然后,它会围绕已识别的主观性词构建一个"簇"(cluster)。在这个簇内,价向移位词(valence shifters) 会调整得分。价向移位词是指能增强或否定该主观性词情感意图的词。例如,"well known" 是正向,而 "not well known" 是负向。这里的 "not" 是否定词,反转了 "well known" 的情感意图。相反,"very well known" 使用了增强词,使正向意图更强。
接着,polarity() 会基于主观性词、价向移位词,以及该段落的总词数来计算分数。本练习演示一次简单的极性计算。在下一个视频中,我们将更深入地了解 polarity() 的内部工作原理。
本练习是课程的一部分
R 中的情感分析
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Example statement
positive <- "DataCamp courses are good for learning"
# Calculate polarity of statement
(pos_score <-___(___))