Construire et évaluer un modèle : critiques de films
Dans cet exercice, vous allez construire un modèle de régression logistique à partir du jeu de données movies. La cote est stockée dans la colonne label et vaut 1 quand la critique est positive et 0 quand elle est négative. La critique textuelle a été transformée en colonnes numériques au moyen de BOW.
Vous avez déjà construit un classificateur, mais vous l'avez évalué en utilisant les mêmes données que pour l'entraînement. Assurez-vous maintenant d'évaluer le modèle avec un jeu de test jamais vu. Comment la performance du modèle change-t‑elle lorsqu'on l'évalue sur l'ensemble de test ?
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Importez la fonction nécessaire pour effectuer la séparation entraînement/test.
- Effectuez la séparation entraînement/test en précisant que 20 % des données doivent servir d'ensemble de test.
- Entraînez un modèle de régression logistique.
- Affichez l'exactitude du modèle sur les données d'entraînement et sur les données de test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the required packages
from sklearn.linear_model import LogisticRegression
____
# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)
# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)
# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))