Attribuer des sujets aux documents
Créer des modèles LDA ne sert à rien si vous ne pouvez pas interpréter et utiliser les résultats. On vous a fourni les résultats de l'exécution d'un modèle LDA, sentence_lda, sur un ensemble de phrases, pig_sentences. Vous devez explorer à la fois la matrice beta, qui donne les mots les plus représentatifs par sujet, et la matrice gamma, qui donne les sujets les plus représentatifs par document, pour bien comprendre les résultats de toute analyse LDA.
À partir de ce que vous savez sur ces deux matrices, extrayez les résultats pour un sujet précis et vérifiez si le résultat correspond à vos attentes.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Créez un tibble pour les matrices
betaetgamma. - Explorez le sujet 5 en examinant les mots les plus représentatifs pour ce sujet, en ordonnant les résultats par valeurs
betadécroissantes. - Explorez le sujet 5 en identifiant quelles phrases s'alignent le mieux avec ce sujet, en ordonnant les résultats par valeurs
gammadécroissantes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)