Centrování a škálování pro klasifikaci
Teď spojíš škálování a budování modelu do jednoho pipeline pro křížovou validaci.
Tvým úkolem je sestavit pipeline, která škáluje příznaky v datasetu music_df a provádí grid search křížovou validaci pomocí modelu logistické regrese s různými hodnotami hyperparametru C. Cílová proměnná je zde "genre", která obsahuje binární hodnoty: rock jako 1 a jakýkoli jiný žánr jako 0.
StandardScaler, LogisticRegression a GridSearchCV jsou již naimportovány.
Toto cvičení je součástí kurzu
Supervised Learning with scikit-learn
Pokyny k cvičení
- Vytvoř kroky pipeline: objekt
StandardScaler()pojmenovaný"scaler"a model logistické regrese pojmenovaný"logreg". - Vytvoř
parameterstak, aby prohledávaly 20 rovnoměrně rozložených hodnot typu float v rozsahu od0.001do1.0pro hyperparametrCmodelu logistické regrese v rámci pipeline. - Vytvoř instanci objektu grid search.
- Natrénuj objekt grid search na trénovacích datech.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build the steps
steps = [("____", ____()),
("____", ____())]
pipeline = Pipeline(steps)
# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2,
random_state=21)
# Instantiate the grid search object
cv = ____(____, param_grid=____)
# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)