Évaluations de produits avec régularisation
Dans cet exercice, vous allez travailler de nouveau avec l'ensemble de données reviews des évaluations de produits Amazon. Un vecteur d'étiquettes y contient le sentiment : 1 si positif et 0 sinon. La matrice X regroupe toutes les caractéristiques numériques créées à l'aide d'une approche BOW.
Vous devrez entraîner deux modèles de régression logistique avec des niveaux de régularisation différents et comparer leur performance sur les données de test. Rappelez-vous que la régularisation sert à contrôler la complexité du modèle. Plus un modèle est régularisé, moins il est flexible, mais mieux il peut généraliser. Les modèles avec un niveau de régularisation élevé sont souvent moins précis que ceux sans régularisation.
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Scindez les données en ensembles d'entraînement et de test.
- Entraînez une régression logistique avec un paramètre de régularisation de
1000. Entraînez une deuxième régression logistique avec un paramètre de régularisation égal à0.001. - Affichez les scores de justesse des deux modèles sur l'ensemble de test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)
# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)
# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))