CommencezCommencez gratuitement

Attribuer des sujets aux documents

Créer des modèles LDA ne sert à rien si vous ne pouvez pas interpréter et utiliser les résultats. On vous a fourni les résultats de l'exécution d'un modèle LDA, sentence_lda, sur un ensemble de phrases, pig_sentences. Vous devez explorer à la fois la matrice beta, qui donne les mots les plus représentatifs par sujet, et la matrice gamma, qui donne les sujets les plus représentatifs par document, pour bien comprendre les résultats de toute analyse LDA.

À partir de ce que vous savez sur ces deux matrices, extrayez les résultats pour un sujet précis et vérifiez si le résultat correspond à vos attentes.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Créez un tibble pour les matrices beta et gamma.
  • Explorez le sujet 5 en examinant les mots les plus représentatifs pour ce sujet, en ordonnant les résultats par valeurs beta décroissantes.
  • Explorez le sujet 5 en identifiant quelles phrases s'alignent le mieux avec ce sujet, en ordonnant les résultats par valeurs gamma décroissantes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")

# Explore Topic 5 Betas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)

# Explore Topic 5 Gammas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)
Modifier et exécuter le code