Tester la perplexité
Vous disposez d’un jeu de données rempli de tweets envoyés par des bots durant l’élection américaine de 2016. Votre responsable a identifié deux types de comptes d’intérêt, Left et Right. Il vous demande d’appliquer un topic modeling aux tweets provenant des bots Right. De plus, il souhaite résumer le contenu de ces tweets grâce au topic modeling. Réalisez un topic modeling avec 5, 15 et 50 sujets afin d’estimer le nombre de sujets présents dans les données.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]
# Peform topic modeling
lda_model <- LDA(___, k = ___, method = ___,
control = list(seed = 1111))
# Train
___(lda_model, newdata = ___)
# Test
___(lda_model, newdata = ___)