lda_topics 包含对 Twitter 数据运行 LDA 后得到的主题。请记住,每个主题都是语料库中所有唯一词的概率分布集合。本题中,每条推文都是一个文档,beta 列存放的是词概率。
lda_topics
beta
本练习是课程的一部分
通过完成这段示例代码来试试这个练习。
# Print the output from LDA run ___
由于文本属于非结构化数据,需要进行一定的整理,才能转化为可分析的形式。本章将介绍如何通过分词、清洗,并将文本视为分类数据等方式,为文本添加结构。
计数固然有用,但可视化更能直观呈现信息。本章将学习如何把您在 ggplot2 中掌握的方法应用到 tidy 文本数据上。
词频和可视化能够暗示内容信息,但我们还能做得更多。本章将超越单纯的词频,分析文本的情感或情绪倾向。
在最后一章中,我们将超越词频,挖掘文档集合中潜在的主题。我们将使用一种标准的主题模型:潜在狄利克雷分配(latent Dirichlet allocation)。
当前练习