CommencezCommencez gratuitement

Exemple de modélisation de classification

Vous avez déjà préparé un ensemble de tweets russes pour la classification. Sur les 20 000 tweets, vous avez filtré ceux dont la valeur account_type est Left ou Right, puis sélectionné les 2 000 premiers tweets de chaque type. Vous avez déjà tokenisé les tweets en mots, retiré les mots vides et effectué la racinisation. De plus, vous avez transformé les décomptes de mots en une matrice termes-documents avec des poids TF‑IDF, enregistrée sous : left_right_matrix_small.

Vous utiliserez cette matrice pour prédire si un tweet provient d'un robot de tweets de tendance gauche ou de tendance droite. Les étiquettes se trouvent dans le vecteur left_right_labels.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Fixez la graine aléatoire à 1111 pour assurer la reproductibilité.
  • Créez les ensembles d'entraînement et de test. Utilisez un échantillon de 75 % pour les données d'entraînement.
  • Exécutez un modèle de forêt aléatoire sur les données d'entraînement, en utilisant left_right_labels comme vecteur de réponse y.
  • Affichez les résultats de la forêt aléatoire.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
Modifier et exécuter le code