Centrowanie i skalowanie w regresji
Skoro znasz już zalety skalowania danych, użyjesz potoku, aby przetworzyć cechy ze zbioru music_df i zbudować model regresji lasso do przewidywania głośności utworu.
Zbiory X_train, X_test, y_train i y_test zostały utworzone na podstawie zbioru danych music_df, gdzie zmienną docelową jest "loudness", a cechami są wszystkie pozostałe kolumny. Lasso i Pipeline zostały już zaimportowane.
Zwróć uwagę, że kolumna "genre" została przekształcona na cechę binarną, gdzie 1 oznacza utwór rockowy, a 0 reprezentuje pozostałe gatunki.
To ćwiczenie jest częścią kursu
Nadzorowane uczenie maszynowe z scikit-learn
Instrukcje do ćwiczenia
- Zaimportuj
StandardScaler. - Utwórz kroki potoku: obiekt
StandardScalero nazwie"scaler"oraz model lasso o nazwie"lasso"z parametremalphaustawionym na0.5. - Utwórz instancję potoku z krokami służącymi do skalowania i budowania modelu regresji lasso.
- Oblicz wartość R-kwadrat na danych testowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))