Kom igångKom igång gratis

Centrering och skalning för klassificering

Nu ska du kombinera skalning och modellbyggande i en pipeline för korsvalidering.

Din uppgift är att bygga en pipeline som skalar särdrag i datamängden music_df och utför korsvalidering med rutnätssökning med hjälp av en logistisk regressionsmodell med olika värden för hyperparametern C. Målvariabeln här är "genre", som innehåller binära värden där rock representeras av 1 och alla andra genrer av 0.

StandardScaler, LogisticRegression och GridSearchCV har redan importerats åt dig.

Den här övningen är en del av kursen

Övervakad inlärning med scikit-learn

Visa kurs

Övningsinstruktioner

  • Bygg stegen för pipelinen: ett StandardScaler()-objekt med namnet "scaler" och en logistisk regressionsmodell med namnet "logreg".
  • Skapa parameters genom att söka igenom 20 jämnt fördelade flyttalsvärden från 0.001 till 1.0 för den logistiska regressionsmodellens hyperparameter C inom pipelinen.
  • Instansiera rutnätssökningsobjektet.
  • Anpassa rutnätssökningsobjektet till träningsdatan.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Build the steps
steps = [("____", ____()),
         ("____", ____())]
pipeline = Pipeline(steps)

# Create the parameter space
parameters = {"____": np.____(____, ____, 20)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, 
                                                    random_state=21)

# Instantiate the grid search object
cv = ____(____, param_grid=____)

# Fit to the training data
cv.____(____, ____)
print(cv.best_score_, "\n", cv.best_params_)
Redigera och kör kod