Zacznij terazZacznij za darmo

Centrowanie i skalowanie w regresji

Skoro znasz już zalety skalowania danych, użyjesz potoku, aby przetworzyć cechy ze zbioru music_df i zbudować model regresji lasso do przewidywania głośności utworu.

Zbiory X_train, X_test, y_train i y_test zostały utworzone na podstawie zbioru danych music_df, gdzie zmienną docelową jest "loudness", a cechami są wszystkie pozostałe kolumny. Lasso i Pipeline zostały już zaimportowane.

Zwróć uwagę, że kolumna "genre" została przekształcona na cechę binarną, gdzie 1 oznacza utwór rockowy, a 0 reprezentuje pozostałe gatunki.

To ćwiczenie jest częścią kursu

Nadzorowane uczenie maszynowe z scikit-learn

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj StandardScaler.
  • Utwórz kroki potoku: obiekt StandardScaler o nazwie "scaler" oraz model lasso o nazwie "lasso" z parametrem alpha ustawionym na 0.5.
  • Utwórz instancję potoku z krokami służącymi do skalowania i budowania modelu regresji lasso.
  • Oblicz wartość R-kwadrat na danych testowych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import StandardScaler
____

# Create pipeline steps
steps = [("____", ____()),
         ("____", ____(alpha=____))]

# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)

# Calculate and print R-squared
print(____.____(____, ____))
Edytuj i uruchom kod