or
本练习是课程的一部分
由于文本属于非结构化数据,需要进行一定的整理,才能转化为可分析的形式。本章将介绍如何通过分词、清洗,并将文本视为分类数据等方式,为文本添加结构。
当前练习
计数固然有用,但可视化更能直观呈现信息。本章将学习如何把您在 ggplot2 中掌握的方法应用到 tidy 文本数据上。
词频和可视化能够暗示内容信息,但我们还能做得更多。本章将超越单纯的词频,分析文本的情感或情绪倾向。
在最后一章中,我们将超越词频,挖掘文档集合中潜在的主题。我们将使用一种标准的主题模型:潜在狄利克雷分配(latent Dirichlet allocation)。