CommencerCommencez gratuitement

Passer en revue les résultats LDA

Vous avez construit un modèle de thèmes, napoleon_model, avec 5 thèmes pour les phrases du livre La Ferme des animaux qui font référence au personnage principal, Napoléon. Vous avez demandé à 5 auteurs locaux d’examiner les mots et phrases les plus représentatifs de chaque thème, et ils vous ont proposé un intitulé/thème pour chacun.

Pour finaliser vos résultats, préparez quelques statistiques descriptives sur les thèmes. Vous présenterez ces valeurs de synthèse, accompagnées des intitulés, à votre responsable pour validation.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Extrayez la matrice gamma du modèle de thèmes, napoleon_model.
  • Utilisez les fonctions de dplyr pour créer un tibble du thème dominant dans chaque phrase, appelé grouped_gammas.
  • À partir de grouped_gammas, comptez le nombre de phrases les plus proches de chaque thème.
  • À partir de grouped_gammas, calculez la valeur moyenne de gamma pour chaque thème.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Extract the gamma matrix 
gamma_values <- tidy(___, matrix = ___)
# Create grouped gamma tibble
grouped_gammas <- gamma_values %>%
  ___(document) %>%
  ___(desc(gamma)) %>%
  ___(1) %>%
  ___(topic)
# Count (tally) by topic
grouped_gammas %>% 
  ___(topic, sort=TRUE)
# Average topic weight for top topic for each sentence
grouped_gammas %>% 
  ___(avg=mean(gamma)) %>%
  ___(desc(avg))
Modifier et exécuter le code