Centrare și scalare pentru regresie
Acum că ai văzut beneficiile scalării datelor, vei folosi un pipeline pentru a preprocesa caracteristicile din setul de date music_df și pentru a construi un model de regresie lasso care să prezică intensitatea sonoră a unui cântec.
X_train, X_test, y_train și y_test au fost create din setul de date music_df, unde variabila țintă este "loudness", iar caracteristicile sunt toate celelalte coloane din set. Lasso și Pipeline au fost deja importate pentru tine.
Reține că "genre" a fost convertit la o caracteristică binară, unde 1 indică un cântec rock, iar 0 reprezintă alte genuri.
Acest exercițiu face parte din cursul
Învățare supravegheată cu scikit-learn
Instrucțiuni pentru exercițiu
- Importă
StandardScaler. - Creează pașii pentru obiectul pipeline: un obiect
StandardScalernumit"scaler"și un model lasso numit"lasso"cualphasetat la0.5. - Instanțiază un pipeline cu pașii necesari pentru a scala datele și a construi un model de regresie lasso.
- Calculează valoarea R-pătrat pe datele de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))