Pipeline pour prédire la popularité d'une chanson
Pour cet exercice final, vous allez créer un pipeline pour imputer les valeurs manquantes, mettre les variables à l'échelle et ajuster les hyperparamètres d'un modèle de régression logistique. L'objectif est de trouver les meilleurs paramètres et la meilleure exactitude pour prédire le genre d'une chanson !
Tous les modèles et objets nécessaires à la création du pipeline ont été préchargés pour vous.
Cette activité fait partie du cours
Apprentissage supervisé avec scikit-learn
Instructions de l’exercice
- Créez les étapes du pipeline en appelant un simple imputeur, un standard scaler et un modèle de régression logistique.
- Créez un objet pipeline et transmettez‑lui la variable
steps. - Instanciez un objet de recherche sur grille pour effectuer une validation croisée en utilisant le pipeline et les paramètres.
- Affichez les meilleurs paramètres, puis calculez et affichez la précision sur l'ensemble de test pour l'objet de recherche sur grille.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create steps
steps = [("imp_mean", ____()),
("scaler", ____()),
("logreg", ____())]
# Set up pipeline
pipeline = ____(____)
params = {"logreg__solver": ["newton-cg", "saga", "lbfgs"],
"logreg__C": np.linspace(0.001, 1.0, 10)}
# Create the GridSearchCV object
tuning = ____(____, param_grid=____)
tuning.fit(X_train, y_train)
y_pred = tuning.predict(X_test)
# Compute and print performance
print("Tuned Logistic Regression Parameters: {}, Accuracy: {}".format(____.____, ____.____))