CommencezCommencez gratuitement

Construire et évaluer un modèle : critiques de films

Dans cet exercice, vous allez construire un modèle de régression logistique à partir du jeu de données movies. La cote est stockée dans la colonne label et vaut 1 quand la critique est positive et 0 quand elle est négative. La critique textuelle a été transformée en colonnes numériques au moyen de BOW.

Vous avez déjà construit un classificateur, mais vous l'avez évalué en utilisant les mêmes données que pour l'entraînement. Assurez-vous maintenant d'évaluer le modèle avec un jeu de test jamais vu. Comment la performance du modèle change-t‑elle lorsqu'on l'évalue sur l'ensemble de test ?

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Importez la fonction nécessaire pour effectuer la séparation entraînement/test.
  • Effectuez la séparation entraînement/test en précisant que 20 % des données doivent servir d'ensemble de test.
  • Entraînez un modèle de régression logistique.
  • Affichez l'exactitude du modèle sur les données d'entraînement et sur les données de test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the required packages
from sklearn.linear_model import LogisticRegression
____

# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)

# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)

# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))
Modifier et exécuter le code