Pratique LDA
Vous souhaitez explorer les thèmes récurrents autour du personnage Napoléon dans votre nouveau livre préféré, La Ferme des animaux. Napoléon est un cochon qui convainc ses camarades de renverser leurs dirigeants humains. Il finit aussi par devenir le nouveau chef de la Ferme des animaux.
Vous avez extrait toutes les phrases qui mentionnent Napoléon, pig_sentences, et créé une version tokenisée de ces phrases avec les stop words retirés et une racinisation effectuée, pig_tokens. Réalisez une LDA sur ces phrases et examinez les mots les plus associés à certains sujets.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Effectuez une LDA sur
pig_matrixen identifiant 10 sujets. Fixez une graine aléatoire à1111pour la reproductibilité. - Extrayez la matrice beta des résultats.
- Filtrez la matrice beta sur le sujet 2 uniquement et triez les valeurs par ordre décroissant de beta.
- Filtrez la matrice beta sur le sujet 3 uniquement et triez les valeurs par ordre décroissant de beta.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(topicmodels)
# Perform Topic Modeling
sentence_lda <-
___(___, k = ___, method = 'Gibbs', control = list(seed = ___))
# Extract the beta matrix
sentence_betas <- ___(sentence_lda, matrix = "___")
# Topic #2
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)
# Topic #3
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)