开始使用免费开始使用

创建适合树状图的 TDM

既然您已经理解了创建树状图的步骤,就可以把它们应用到文本上。不过,在此之前,您需要使用 tm 包中的 removeSparseTerms() 来限制 TDM 中的词数。为什么要调整 TDM/DTM 的稀疏度?

TDM 和 DTM 都是稀疏矩阵,也就是说它们大多是 0。请记住,1000 条推文就可能生成一个包含超过 3000 个词项的 TDM!如果文本更多,如此杂乱的树状图将难以解读。

在大多数专业场景中,一个好的树状图通常基于包含 25 到 70 个词项的 TDM。超过 70 个词项,图形可能会显得杂乱且难以理解;少于 25 个词项,则可能导致树状图无法展示有意义且有洞见的聚类。

使用 removeSparseTerms() 时,sparse 参数会调整在 TDM 中保留的总词项数。sparse 越接近 1,保留的词项就越多。该值表示对每个词项在 TDM 中 0 的比例阈值。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

tweets_tdm 已基于 chardonnay 相关推文创建。

  • tweets_tdm 的维度打印到控制台。
  • tweets_tdm 上使用 removeSparseTerms(),设置 sparse = 0.95,创建 tdm1
  • tweets_tdm 上使用 removeSparseTerms(),设置 sparse = 0.975,创建 tdm2
  • tdm1 打印到控制台,查看剩余的词项数。
  • tdm2 打印到控制台,查看剩余的词项数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Print the dimensions of tweets_tdm
___

# Create tdm1
___ <- ___(___, ___)

# Create tdm2
___ <- ___(___, ___)

# Print tdm1
___

# Print tdm2
___
编辑并运行代码