Standardizarea
Deși normalizarea poate fi utilă pentru scalarea unei coloane între două valori, este dificil să compari două coloane scalate dacă cel puțin una dintre ele este puternic influențată de valori extreme (outlieri). O soluție des folosită în astfel de situații este standardizarea: în loc să impui o limită superioară și una inferioară stricte, centrezi datele în jurul mediei și calculezi numărul de abateri standard față de medie pentru fiecare punct de date.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Importă
StandardScalerdin modululpreprocessingal biblioteciisklearn. - Inițializează
StandardScaler()caSS_scaler. - Antrenează
StandardScalerpe coloanaAgedinso_numeric_df. - Transformă aceeași coloană folosind scalarul pe care tocmai l-ai antrenat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import StandardScaler
____
# Instantiate StandardScaler
SS_scaler = ____()
# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())