Exemple de modélisation de classification
Vous avez déjà préparé un ensemble de tweets russes pour une tâche de classification. Parmi les 20 000 tweets, vous avez filtré ceux dont account_type est Left ou Right, puis sélectionné les 2 000 premiers de chaque catégorie. Vous avez déjà tokenisé les tweets en mots, supprimé les stop words et effectué le stemming. De plus, vous avez converti les occurrences de mots en une matrice documents-termes avec des pondérations TF-IDF et enregistré cette matrice sous : left_right_matrix_small.
Vous allez utiliser cette matrice pour prédire si un tweet a été généré par un bot à tendance gauche ou à tendance droite. Les étiquettes se trouvent dans le vecteur left_right_labels.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Définissez la graine aléatoire à
1111pour assurer la reproductibilité. - Créez les jeux d’entraînement et de test. Utilisez un échantillon de 75 % pour les données d’entraînement.
- Exécutez un modèle de random forest sur les données d’entraînement, en utilisant
left_right_labelspour le vecteur de réponsey. - Affichez les résultats de la random forest.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(randomForest)
# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]
# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)),
y = ___[___],
nTree = 50)
# Print the results
___