Attribuer des thèmes aux documents
Créer des modèles LDA ne sert à rien si vous ne pouvez pas interpréter et exploiter les résultats. On vous a fourni les résultats de l’exécution d’un modèle LDA, sentence_lda, sur un ensemble de phrases, pig_sentences. Pour bien comprendre toute analyse LDA, vous devez explorer les matrices beta (mots les plus représentatifs par thème) et gamma (thèmes dominants par document).
À partir de ce que vous savez sur ces deux matrices, extrayez les résultats pour un thème précis et vérifiez si la sortie correspond à ce que vous attendez.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Créez un tibble pour les matrices
betaetgamma. - Explorez le thème 5 en examinant les mots les plus représentatifs du thème 5, en triant les résultats par valeurs
betadécroissantes. - Explorez le thème 5 en identifiant les phrases qui s’alignent le plus avec le thème 5, en triant les résultats par valeurs
gammadécroissantes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)