CommencezCommencez gratuitement

Analyse de sentiments avec GBM

Utilisons maintenant le GradientBoostingClassifier de scikit-learn sur l'ensemble de données reviews pour prédire le sentiment d'un commentaire à partir de son texte.

Nous ne passerons pas le texte brut en entrée du modèle. Le prétraitement suivant a été effectué pour vous :

  1. Retirer les commentaires avec des valeurs manquantes.
  2. Sélectionner les données des 5 applications les plus populaires.
  3. Sélectionner un sous-échantillon aléatoire de 500 commentaires.
  4. Retirer les « mots vides » des commentaires.
  5. Transformer les commentaires en matrice où chaque caractéristique représente la fréquence d'un mot dans un commentaire.

Vous voulez approfondir l'exploration de textes ? Consultez le cours Introduction to Natural Language Processing in Python!

Cette activité fait partie du cours

Méthodes d'ensemble en Python

Voir le cours

Instructions de l’exercice

  • Créez un GradientBoostingClassifier avec 100 estimateurs et un taux d'apprentissage de 0.1.
  • Calculez les prédictions sur l'ensemble de test.
  • Calculez la justesse (accuracy) pour évaluer le modèle.
  • Calculez et affichez la matrice de confusion.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Modifier et exécuter le code