回顾 LDA 结果
您已经为《动物庄园》中涉及主角拿破仑的句子训练了一个包含 5 个主题的主题模型 napoleon_model。您请了 5 位本地作者审阅了每个主题的高频词和代表性句子,并为各主题提供了主题概述。
为最终汇总结果,请准备一些关于这些主题的汇总统计量。您将把这些汇总数值与对应的主题一起提交给您的主管审阅。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 从主题模型
napoleon_model中提取 gamma 矩阵。 - 使用
dplyr函数创建一个包含每个句子最高主题的 tibble,命名为grouped_gammas。 - 使用
grouped_gammas统计最接近各主题的句子数量。 - 使用
grouped_gammas计算各主题的平均 gamma 值。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Extract the gamma matrix
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
___(document) %>%
___(desc(gamma)) %>%
___(1) %>%
___(topic)
# Count (tally) by topic
grouped_gammas %>%
___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>%
___(avg=mean(gamma)) %>%
___(desc(avg))