适用于文档分组的矩形树图
在实际工作中,您常常需要处理按作者、产品或公司等分组的文档。本练习将帮助您在紧凑的可视化中保留分组,同时了解文本内容。例如,对于按产品分组的用户评论,您可能希望同时探索评论的多个维度。首先,您可以计算评论的 polarity()(极性)。另一个维度可能是长度。文档长度可以体现情感强度。如果一位客户只留下简短的"great shoes!",与更长的正面评价相比,您可以推断其实际热情度可能更低。您也可能希望按产品类型分组评论,例如女鞋、男鞋和童鞋。矩形树图可以让您同时审视这些维度。
对于文本分析,在矩形树图中,每个小方块代表一篇文档,例如一条推文。文档会按某种方式分组,如作者。每个方块的大小由某个数值决定,例如单词数或字母数。每个方块的颜色由情感得分决定。
整理好 tibble 之后,使用包含 treemap() 函数的 treemap 库生成可视化。下面的代码示例声明了数据、分组变量、大小、颜色及其他外观设置。
treemap(
data_frame,
index = c("group", "individual_document"),
vSize = "doc_length",
vColor = "avg_score",
type = "value",
title = "Sentiment Scores by Doc",
palette = c("red", "white", "green")
)
预加载的 all_books 对象包含一个合并后的整洁格式语料库,含 4 本 Shakespeare、3 本 Melville 和 4 本 Twain 的书。通过矩形树图,您应该能够看出谁写的书更长,以及作者整体和各本书的情感极性。
本练习是课程的一部分
R 中的情感分析
交互式实操练习
通过完成这段示例代码来试试这个练习。
book_length <- all_books %>%
# Count number of words per book
___(___)
# Examine the results
book_length