开始使用免费开始使用

距离矩阵与树状图

进行词聚类分析的一个简单方法,是在词-文档矩阵上绘制树状图。得到 TDM 之后,您可以调用 dist() 来计算矩阵中每一行之间的差异。

接下来,调用 hclust(),对距离矩阵的不相似度进行聚类分析。最后,您可以用树状图和 plot() 可视化词频之间的距离。在文本挖掘中,常常可以根据树状图发现一些有趣的见解或词语簇。

回顾您在上一段视频中看到的年降雨量表。Cleveland 和 Portland 的降雨量相同,因此它们之间的距离为 0。您可能会预期这两个城市会聚成一簇,而 New Orleans 由于降雨量高得多,会单独成簇。

       city rainfall
  Cleveland    39.14
   Portland    39.14
     Boston    43.77
New Orleans    62.45

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

数据框 rain 已预加载到您的工作区。

  • 使用 dist() 作用于 rain 的第二列数值,创建 dist_rain
  • 在控制台打印 dist_rain 矩阵。
  • 使用 hclust()dist_rain 执行聚类分析,创建 hc
  • 使用 plot() 绘制 hc 对象,并设置 labels = rain$city 以添加城市名称。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create dist_rain
___ <- ___(___)

# View the distance matrix
___

# Create hc
___ <- ___(___)

# Plot hc
___(___, ___)
编辑并运行代码