Centrering och skalning för klassificering
Nu ska du kombinera skalning och modellbyggande i en pipeline för korsvalidering.
Din uppgift är att bygga en pipeline som skalar särdrag i datamängden music_df och utför korsvalidering med rutnätssökning med hjälp av en logistisk regressionsmodell med olika värden för hyperparametern C. Målvariabeln här är "genre", som innehåller binära värden där rock representeras av 1 och alla andra genrer av 0.
StandardScaler, LogisticRegression och GridSearchCV har redan importerats åt dig.
Den här övningen är en del av kursen
Övervakad inlärning med scikit-learn
Övningsinstruktioner
- Bygg stegen för pipelinen: ett
StandardScaler()-objekt med namnet"scaler"och en logistisk regressionsmodell med namnet"logreg". - Skapa
parametersgenom att söka igenom 20 jämnt fördelade flyttalsvärden från0.001till1.0för den logistiska regressionsmodellens hyperparameterCinom pipelinen. - Instansiera rutnätssökningsobjektet.
- Anpassa rutnätssökningsobjektet till träningsdatan.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Build the steps
steps = [("____", ____()),
("____", ____())]
pipeline = Pipeline(steps)
# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2,
random_state=21)
# Instantiate the grid search object
cv = ____(____, param_grid=____)
# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)