amzn_cons 聚类树状图
从评论中看,长工时与较差的工作与生活平衡的迹象很明显。作为一种简单的聚类方法,您决定执行层次聚类并创建树状图,以查看这些短语之间的关联程度。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 使用
amzn_cons_corp创建amzn_c_tdm,类型为TermDocumentMatrix,并设置control = list(tokenize = tokenizer)。 - 将
amzn_c_tdm打印到控制台。 - 通过对
amzn_c_tdm调用removeSparseTerms()并将sparse参数设为.993,创建amzn_c_tdm2。 - 创建层次聚类对象
hc:将距离矩阵dist(amzn_c_tdm2)作为嵌套输入传入hclust()函数,同时传入method = "complete"。 - 绘制
hc,查看聚类后的二元词组,看看 Amazon 缺点部分中的概念如何帮助您得出结论。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Print amzn_c_tdm to the console
___
# Create amzn_c_tdm2 by removing sparse terms
___ <- ___
# Create hc as a cluster of distance values
___ <- ___(___,
___)
# Produce a plot of hc
___