CommencezCommencez gratuitement

Exercice de LDA

Vous souhaitez découvrir les thèmes récurrents autour du personnage Napoléon dans votre nouveau livre préféré, La ferme des animaux. Napoléon est un cochon qui convainc ses camarades de renverser leurs dirigeants humains. Il finit aussi par devenir le nouveau dirigeant de La ferme des animaux.

Vous avez extrait toutes les phrases qui mentionnent le nom de Napoléon, pig_sentences, et créé une version tokenisée de ces phrases avec les mots vides retirés et la racinisation effectuée, pig_tokens. Réalisez une LDA sur ces phrases et examinez les mots les plus associés à certains sujets.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Exécutez une LDA sur pig_matrix en identifiant 10 sujets. Définissez une graine aléatoire 1111 pour la reproductibilité.
  • Extrayez la matrice beta des résultats.
  • Filtrez la matrice beta pour le sujet 2 seulement et triez les valeurs par ordre décroissant de beta.
  • Filtrez la matrice beta pour le sujet 3 seulement et triez les valeurs par ordre décroissant de beta.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

library(topicmodels)
# Perform Topic Modeling
sentence_lda <-
  ___(___, k = ___, method = 'Gibbs', control = list(seed = ___))
# Extract the beta matrix 
sentence_betas <- ___(sentence_lda, matrix = "___")

# Topic #2
sentence_betas %>%
  ___(topic == ___) %>%
  arrange(-___)
# Topic #3
sentence_betas %>%
  ___(topic == ___) %>%
  arrange(-___)
Modifier et exécuter le code