CommencerCommencez gratuitement

Tester la perplexité

Vous disposez d’un jeu de données rempli de tweets envoyés par des bots durant l’élection américaine de 2016. Votre responsable a identifié deux types de comptes d’intérêt, Left et Right. Il vous demande d’appliquer un topic modeling aux tweets provenant des bots Right. De plus, il souhaite résumer le contenu de ces tweets grâce au topic modeling. Réalisez un topic modeling avec 5, 15 et 50 sujets afin d’estimer le nombre de sujets présents dans les données.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
Modifier et exécuter le code