CommencerCommencez gratuitement

Attribuer des thèmes aux documents

Créer des modèles LDA ne sert à rien si vous ne pouvez pas interpréter et exploiter les résultats. On vous a fourni les résultats de l’exécution d’un modèle LDA, sentence_lda, sur un ensemble de phrases, pig_sentences. Pour bien comprendre toute analyse LDA, vous devez explorer les matrices beta (mots les plus représentatifs par thème) et gamma (thèmes dominants par document).

À partir de ce que vous savez sur ces deux matrices, extrayez les résultats pour un thème précis et vérifiez si la sortie correspond à ce que vous attendez.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Créez un tibble pour les matrices beta et gamma.
  • Explorez le thème 5 en examinant les mots les plus représentatifs du thème 5, en triant les résultats par valeurs beta décroissantes.
  • Explorez le thème 5 en identifiant les phrases qui s’alignent le plus avec le thème 5, en triant les résultats par valeurs gamma décroissantes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")

# Explore Topic 5 Betas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)

# Explore Topic 5 Gammas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)
Modifier et exécuter le code