CommencezCommencez gratuitement

Mettre à l'épreuve la perplexité

On vous a fourni un jeu de données rempli de tweets envoyés par des robots Twitter pendant l'élection américaine de 2016. Votre patron a repéré deux types de comptes d'intérêt, Left et Right. Il vous demande d'appliquer un modèle thématique aux tweets provenant des robots Right. De plus, il souhaite résumer le contenu de ces tweets au moyen du modelage thématique. Effectuez un modelage thématique avec 5, 15 et 50 thèmes pour estimer de façon générale combien de thèmes se trouvent dans les données.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
Modifier et exécuter le code