为文档分配主题
如果无法解释并使用结果,创建 LDA 模型就没有意义。您拿到的是在一组句子 pig_sentences 上运行 LDA 模型 sentence_lda 的结果。要全面理解任何 LDA 分析的结果,您需要同时查看 beta(按主题的高频词)和 gamma(每个文档的主导主题)这两个矩阵。
基于您对这两个矩阵的了解,请提取某个特定主题的结果,并检查输出是否符合预期。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 为
beta和gamma两个矩阵分别创建一个 tibble。 - 通过查看主题 5 的高频词来探索主题 5,并按
beta值从大到小排列结果。 - 通过查看最贴合主题 5 的句子来探索主题 5,并按
gamma值从大到小排列结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)