Mettre à l'épreuve la perplexité
On vous a fourni un jeu de données rempli de tweets envoyés par des robots Twitter pendant l'élection américaine de 2016. Votre patron a repéré deux types de comptes d'intérêt, Left et Right. Il vous demande d'appliquer un modèle thématique aux tweets provenant des robots Right. De plus, il souhaite résumer le contenu de ces tweets au moyen du modelage thématique. Effectuez un modelage thématique avec 5, 15 et 50 thèmes pour estimer de façon générale combien de thèmes se trouvent dans les données.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]
# Peform topic modeling
lda_model <- LDA(___, k = ___, method = ___,
control = list(seed = 1111))
# Train
___(lda_model, newdata = ___)
# Test
___(lda_model, newdata = ___)