Passer en revue les résultats LDA
Vous avez construit un modèle de thèmes, napoleon_model, avec 5 thèmes pour les phrases du livre La Ferme des animaux qui font référence au personnage principal, Napoléon. Vous avez demandé à 5 auteurs locaux d’examiner les mots et phrases les plus représentatifs de chaque thème, et ils vous ont proposé un intitulé/thème pour chacun.
Pour finaliser vos résultats, préparez quelques statistiques descriptives sur les thèmes. Vous présenterez ces valeurs de synthèse, accompagnées des intitulés, à votre responsable pour validation.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Extrayez la matrice gamma du modèle de thèmes,
napoleon_model. - Utilisez les fonctions de
dplyrpour créer un tibble du thème dominant dans chaque phrase, appelégrouped_gammas. - À partir de
grouped_gammas, comptez le nombre de phrases les plus proches de chaque thème. - À partir de
grouped_gammas, calculez la valeur moyenne de gamma pour chaque thème.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Extract the gamma matrix
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
___(document) %>%
___(desc(gamma)) %>%
___(1) %>%
___(topic)
# Count (tally) by topic
grouped_gammas %>%
___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>%
___(avg=mean(gamma)) %>%
___(desc(avg))