Pipeline pro předpovídání popularity písní
V závěrečném cvičení sestavíš pipeline, která bude imputovat chybějící hodnoty, škálovat příznaky a ladit hyperparametry modelu logistické regrese. Cílem je najít nejlepší parametry a dosáhnout co nejvyšší přesnosti při předpovídání žánru písně!
Všechny potřebné modely a objekty pro sestavení pipeline už jsou pro tebe předem načteny.
Toto cvičení je součástí kurzu
Supervised Learning with scikit-learn
Pokyny k cvičení
- Vytvoř kroky pipeline tak, že zavoláš jednoduchý imputer, standardní scaler a model logistické regrese.
- Vytvoř objekt pipeline a předej mu proměnnou
steps. - Vytvoř objekt grid search pro křížovou validaci s použitím pipeline a zadaných parametrů.
- Vypiš nejlepší parametry a vypočítej a vypiš skóre přesnosti na testovací sadě pro objekt grid search.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create steps
steps = [("imp_mean", ____()),
("scaler", ____()),
("logreg", ____())]
# Set up pipeline
pipeline = ____(____)
params = {"logreg__solver": ["newton-cg", "saga", "lbfgs"],
"logreg__C": np.linspace(0.001, 1.0, 10)}
# Create the GridSearchCV object
tuning = ____(____, param_grid=____)
tuning.fit(X_train, y_train)
y_pred = tuning.predict(X_test)
# Compute and print performance
print("Tuned Logistic Regression Parameters: {}, Accuracy: {}".format(____.____, ____.____))