CommencezCommencez gratuitement

Évaluations de produits avec régularisation

Dans cet exercice, vous allez travailler de nouveau avec l'ensemble de données reviews des évaluations de produits Amazon. Un vecteur d'étiquettes y contient le sentiment : 1 si positif et 0 sinon. La matrice X regroupe toutes les caractéristiques numériques créées à l'aide d'une approche BOW.

Vous devrez entraîner deux modèles de régression logistique avec des niveaux de régularisation différents et comparer leur performance sur les données de test. Rappelez-vous que la régularisation sert à contrôler la complexité du modèle. Plus un modèle est régularisé, moins il est flexible, mais mieux il peut généraliser. Les modèles avec un niveau de régularisation élevé sont souvent moins précis que ceux sans régularisation.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Scindez les données en ensembles d'entraînement et de test.
  • Entraînez une régression logistique avec un paramètre de régularisation de 1000. Entraînez une deuxième régression logistique avec un paramètre de régularisation égal à 0.001.
  • Affichez les scores de justesse des deux modèles sur l'ensemble de test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)

# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)

# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))
Modifier et exécuter le code