Créer et évaluer un modèle : données d'évaluations de produits
Dans cet exercice, vous allez construire une régression logistique en utilisant le jeu de données reviews, qui contient des évaluations de produits Amazon rédigées par des clients. Le tableau y contient le sentiment : 1 si positif et 0 sinon. Le tableau X contient toutes les caractéristiques numériques créées à l'aide d'une approche BOW. N'hésitez pas à les explorer dans l'IPython Shell.
Votre tâche consiste à construire un modèle de régression logistique et à calculer l'exactitude (accuracy) et la matrice de confusion à l'aide du jeu de test.
La régression logistique et les fonctions de séparation entraînement/test ont été importées pour vous.
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Importez les fonctions d'exactitude (accuracy score) et de matrice de confusion.
- Scindez les données en ensembles d'entraînement et de test, en utilisant 30 % des données comme ensemble de test et en fixant la graine aléatoire à
42. - Entraînez un modèle de régression logistique.
- Affichez l'exactitude et la matrice de confusion en utilisant les données de test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the accuracy and confusion matrix
____
# Split the data into training and testing
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.3, ____=42)
# Build a logistic regression
log_reg = ____._____
# Predict the labels
y_predict = log_reg.predict(X_test)
# Print the performance metrics
print('Accuracy score of test data: ', ____(____, ____))
print('Confusion matrix of test data: \n', ____(____, ____)/len(y_test))