Analyse de sentiments avec GBM
Utilisons maintenant le GradientBoostingClassifier de scikit-learn sur l'ensemble de données reviews pour prédire le sentiment d'un commentaire à partir de son texte.
Nous ne passerons pas le texte brut en entrée du modèle. Le prétraitement suivant a été effectué pour vous :
- Retirer les commentaires avec des valeurs manquantes.
- Sélectionner les données des 5 applications les plus populaires.
- Sélectionner un sous-échantillon aléatoire de 500 commentaires.
- Retirer les « mots vides » des commentaires.
- Transformer les commentaires en matrice où chaque caractéristique représente la fréquence d'un mot dans un commentaire.
Vous voulez approfondir l'exploration de textes ? Consultez le cours Introduction to Natural Language Processing in Python!
Cette activité fait partie du cours
Méthodes d'ensemble en Python
Instructions de l’exercice
- Créez un
GradientBoostingClassifieravec100estimateurs et un taux d'apprentissage de0.1. - Calculez les prédictions sur l'ensemble de test.
- Calculez la justesse (accuracy) pour évaluer le modèle.
- Calculez et affichez la matrice de confusion.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)