开始使用免费开始使用

回顾 LDA 结果

您已经为《动物庄园》中涉及主角拿破仑的句子训练了一个包含 5 个主题的主题模型 napoleon_model。您请了 5 位本地作者审阅了每个主题的高频词和代表性句子,并为各主题提供了主题概述。

为最终汇总结果,请准备一些关于这些主题的汇总统计量。您将把这些汇总数值与对应的主题一起提交给您的主管审阅。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 从主题模型 napoleon_model 中提取 gamma 矩阵。
  • 使用 dplyr 函数创建一个包含每个句子最高主题的 tibble,命名为 grouped_gammas
  • 使用 grouped_gammas 统计最接近各主题的句子数量。
  • 使用 grouped_gammas 计算各主题的平均 gamma 值。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Extract the gamma matrix 
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
  ___(document) %>%
  ___(desc(gamma)) %>%
  ___(1) %>%
  ___(topic)
# Count (tally) by topic
grouped_gammas %>% 
  ___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>% 
  ___(avg=mean(gamma)) %>%
  ___(desc(avg))
编辑并运行代码