Exercice de LDA
Vous souhaitez découvrir les thèmes récurrents autour du personnage Napoléon dans votre nouveau livre préféré, La ferme des animaux. Napoléon est un cochon qui convainc ses camarades de renverser leurs dirigeants humains. Il finit aussi par devenir le nouveau dirigeant de La ferme des animaux.
Vous avez extrait toutes les phrases qui mentionnent le nom de Napoléon, pig_sentences, et créé une version tokenisée de ces phrases avec les mots vides retirés et la racinisation effectuée, pig_tokens. Réalisez une LDA sur ces phrases et examinez les mots les plus associés à certains sujets.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Exécutez une LDA sur
pig_matrixen identifiant 10 sujets. Définissez une graine aléatoire1111pour la reproductibilité. - Extrayez la matrice beta des résultats.
- Filtrez la matrice beta pour le sujet 2 seulement et triez les valeurs par ordre décroissant de beta.
- Filtrez la matrice beta pour le sujet 3 seulement et triez les valeurs par ordre décroissant de beta.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(topicmodels)
# Perform Topic Modeling
sentence_lda <-
___(___, k = ___, method = 'Gibbs', control = list(seed = ___))
# Extract the beta matrix
sentence_betas <- ___(sentence_lda, matrix = "___")
# Topic #2
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)
# Topic #3
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)