CommencezCommencez gratuitement

Pipeline pour prédire la popularité d'une chanson

Pour cet exercice final, vous allez créer un pipeline pour imputer les valeurs manquantes, mettre les variables à l'échelle et ajuster les hyperparamètres d'un modèle de régression logistique. L'objectif est de trouver les meilleurs paramètres et la meilleure exactitude pour prédire le genre d'une chanson !

Tous les modèles et objets nécessaires à la création du pipeline ont été préchargés pour vous.

Cette activité fait partie du cours

Apprentissage supervisé avec scikit-learn

Voir le cours

Instructions de l’exercice

  • Créez les étapes du pipeline en appelant un simple imputeur, un standard scaler et un modèle de régression logistique.
  • Créez un objet pipeline et transmettez‑lui la variable steps.
  • Instanciez un objet de recherche sur grille pour effectuer une validation croisée en utilisant le pipeline et les paramètres.
  • Affichez les meilleurs paramètres, puis calculez et affichez la précision sur l'ensemble de test pour l'objet de recherche sur grille.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create steps
steps = [("imp_mean", ____()), 
         ("scaler", ____()), 
         ("logreg", ____())]

# Set up pipeline
pipeline = ____(____)
params = {"logreg__solver": ["newton-cg", "saga", "lbfgs"],
         "logreg__C": np.linspace(0.001, 1.0, 10)}

# Create the GridSearchCV object
tuning = ____(____, param_grid=____)
tuning.fit(X_train, y_train)
y_pred = tuning.predict(X_test)

# Compute and print performance
print("Tuned Logistic Regression Parameters: {}, Accuracy: {}".format(____.____, ____.____))
Modifier et exécuter le code