CommencezCommencez gratuitement

Étape 3 : Créer un classifieur

Voici la dernière étape de la prédiction de sentiment. Nous avons exploré et enrichi notre jeu de données avec des caractéristiques liées au sentiment et créé des vecteurs numériques à partir de celui-ci.

Vous utiliserez le jeu de données que vous avez construit aux étapes précédentes. Il contient notamment une caractéristique pour la longueur des critiques et 200 caractéristiques créées avec le vectoriseur Tfidf.

Votre tâche est d'entraîner une régression logistique pour prédire le sentiment. Les données ont été importées pour vous sous le nom reviews_transformed. La cible s'appelle score et est binaire : 1 lorsque l'évaluation du produit est positive et 0 sinon.

Entraînez un modèle de régression logistique et évaluez sa performance sur les données de test. Le modèle s'en tire-t-il bien ?

Tous les progiciels nécessaires ont été importés pour vous.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Effectuez la division entraînement/test en attribuant 20 % des données au test et en fixant la graine aléatoire à 456.
  • Entraînez un modèle de régression logistique.
  • Prédisez la classe.
  • Affichez l'exactitude (accuracy) et la matrice de confusion sur l'ensemble de test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)

# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)

# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)

# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))
Modifier et exécuter le code