Transformări pe seturile de antrenament și de testare (I)
Până acum ai creat scalere pe baza unei coloane și le-ai aplicat pe aceleași date pe care au fost antrenate. Când construiești modele de machine learning, vei lucra în general cu date istorice (setul de antrenament) și vei aplica modelul pe date noi, nevăzute anterior (setul de testare). În aceste situații, trebuie să te asiguri că aceeași scalare este aplicată atât datelor de antrenament, cât și celor de testare.
Pentru a face asta în practică, antrenezi scalerul pe setul de antrenament și îl păstrezi pentru a-l aplica ulterior pe setul de testare. Nu trebuie să reantrenezi niciodată un scaler pe setul de testare.
Pentru acest exercițiu și pentru cel următor, am împărțit DataFrame-ul so_numeric_df în setul de antrenament (so_train_numeric) și setul de testare (so_test_numeric).
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Instanțiază
StandardScaler()caSS_scaler. - Antrenează
StandardScalerpe coloanaAge. - Transformă coloana
Agedin setul de testare (so_test_numeric).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import StandardScaler
from sklearn.preprocessing import StandardScaler
# Apply a standard scaler to the data
SS_scaler = ____
# Fit the standard scaler to the data
____
# Transform the test data using the fitted scaler
so_test_numeric['Age_ss'] = ____
print(so_test_numeric[['Age', 'Age_ss']].head())