开始使用免费开始使用

amzn_cons 聚类树状图

从评论中看,长工时与较差的工作与生活平衡的迹象很明显。作为一种简单的聚类方法,您决定执行层次聚类并创建树状图,以查看这些短语之间的关联程度。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • 使用 amzn_cons_corp 创建 amzn_c_tdm,类型为 TermDocumentMatrix,并设置 control = list(tokenize = tokenizer)
  • amzn_c_tdm 打印到控制台。
  • 通过对 amzn_c_tdm 调用 removeSparseTerms() 并将 sparse 参数设为 .993,创建 amzn_c_tdm2
  • 创建层次聚类对象 hc:将距离矩阵 dist(amzn_c_tdm2) 作为嵌套输入传入 hclust() 函数,同时传入 method = "complete"
  • 绘制 hc,查看聚类后的二元词组,看看 Amazon 缺点部分中的概念如何帮助您得出结论。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Print amzn_c_tdm to the console
___

# Create amzn_c_tdm2 by removing sparse terms 
___ <- ___

# Create hc as a cluster of distance values
___ <- ___(___,
           ___)

# Produce a plot of hc
___
编辑并运行代码