综合练习:基于文本的树状图
现在请把您的技能用起来,绘制第一个基于文本的树状图。请记住,树状图会对信息进行压缩,帮助您理解数据。这有点像平均值:它能告诉您一些情况,但无法覆盖总体的全部特征,两者都有可能产生误导。对于文本数据,常常会出现许多没有意义的簇,但同时也可能发现一些有价值的簇。
TDM 和 DTM 对象有一个特点:在与 dist() 函数配合使用前,必须先用 as.matrix() 将其转换为矩阵。
在品种为 chardonnay 的推文中,您可能惊讶地在词云里看到了灵魂乐传奇 Marvin Gaye。让我们看看树状图是否也会显示出类似的结果。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 使用
removeSparseTerms()作用于tweets_tdm,并设置sparse = 0.975,创建tweets_tdm2。 - 使用
as.matrix()将tweets_tdm2转换为矩阵形式,创建tdm_m。 - 使用
dist()函数基于tdm_m计算距离,创建tweets_dist。 - 对
tweets_dist使用hclust()创建名为hc的层次聚类对象。 - 使用
plot()和hc绘制树状图。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create tweets_tdm2
___ <- ___(___, ___)
# Create tdm_m
___ <- ___(___)
# Create tweets_dist
___ <- ___(___)
# Create hc
___ <- ___(___)
# Plot the dendrogram
___(___)