开始使用免费开始使用

综合练习:基于文本的树状图

现在请把您的技能用起来,绘制第一个基于文本的树状图。请记住,树状图会对信息进行压缩,帮助您理解数据。这有点像平均值:它能告诉您一些情况,但无法覆盖总体的全部特征,两者都有可能产生误导。对于文本数据,常常会出现许多没有意义的簇,但同时也可能发现一些有价值的簇。

TDM 和 DTM 对象有一个特点:在与 dist() 函数配合使用前,必须先用 as.matrix() 将其转换为矩阵。

在品种为 chardonnay 的推文中,您可能惊讶地在词云里看到了灵魂乐传奇 Marvin Gaye。让我们看看树状图是否也会显示出类似的结果。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • 使用 removeSparseTerms() 作用于 tweets_tdm,并设置 sparse = 0.975,创建 tweets_tdm2
  • 使用 as.matrix()tweets_tdm2 转换为矩阵形式,创建 tdm_m
  • 使用 dist() 函数基于 tdm_m 计算距离,创建 tweets_dist
  • tweets_dist 使用 hclust() 创建名为 hc 的层次聚类对象。
  • 使用 plot()hc 绘制树状图。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create tweets_tdm2
___ <- ___(___, ___)

# Create tdm_m
___ <- ___(___)

# Create tweets_dist
___ <- ___(___)

# Create hc
___ <- ___(___)

# Plot the dendrogram
___(___)
编辑并运行代码