Centrare și scalare pentru clasificare
Acum vei combina scalarea și construirea modelului într-un pipeline pentru validare încrucișată.
Sarcina ta este să construiești un pipeline care să scaleze caracteristicile din setul de date music_df și să efectueze căutare pe grilă cu validare încrucișată, folosind un model de regresie logistică cu valori diferite pentru hiperparametrul C. Variabila țintă este "genre", care conține valori binare: 1 pentru rock și 0 pentru orice alt gen.
StandardScaler, LogisticRegression și GridSearchCV au fost deja importate pentru tine.
Acest exercițiu face parte din cursul
Învățare supravegheată cu scikit-learn
Instrucțiuni pentru exercițiu
- Construiește pașii pentru pipeline: un obiect
StandardScaler()numit"scaler"și un model de regresie logistică numit"logreg". - Creează
parameters, căutând 20 de valori float egal distribuite între0.001și1.0pentru hiperparametrulCal modelului de regresie logistică în cadrul pipeline-ului. - Instanțiază obiectul de căutare pe grilă.
- Antrenează obiectul de căutare pe grilă pe datele de antrenament.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Build the steps
steps = [("____", ____()),
("____", ____())]
pipeline = Pipeline(steps)
# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2,
random_state=21)
# Instantiate the grid search object
cv = ____(____, param_grid=____)
# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)