距离矩阵与树状图
进行词聚类分析的一个简单方法,是在词-文档矩阵上绘制树状图。得到 TDM 之后,您可以调用 dist() 来计算矩阵中每一行之间的差异。
接下来,调用 hclust(),对距离矩阵的不相似度进行聚类分析。最后,您可以用树状图和 plot() 可视化词频之间的距离。在文本挖掘中,常常可以根据树状图发现一些有趣的见解或词语簇。
回顾您在上一段视频中看到的年降雨量表。Cleveland 和 Portland 的降雨量相同,因此它们之间的距离为 0。您可能会预期这两个城市会聚成一簇,而 New Orleans 由于降雨量高得多,会单独成簇。
city rainfall
Cleveland 39.14
Portland 39.14
Boston 43.77
New Orleans 62.45
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
数据框 rain 已预加载到您的工作区。
- 使用
dist()作用于rain的第二列数值,创建dist_rain。 - 在控制台打印
dist_rain矩阵。 - 使用
hclust()对dist_rain执行聚类分析,创建hc。 - 使用
plot()绘制hc对象,并设置labels = rain$city以添加城市名称。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create dist_rain
___ <- ___(___)
# View the distance matrix
___
# Create hc
___ <- ___(___)
# Plot hc
___(___, ___)