Standaryzacja
Normalizacja sprawdza się przy skalowaniu kolumny do określonego przedziału, ale porównywanie dwóch znormalizowanych kolumn staje się trudne, gdy choćby jedna z nich jest silnie zaburzona przez wartości odstające. Popularnym rozwiązaniem tego problemu jest standaryzacja – zamiast wyznaczać sztywne granice, centujesz dane wokół ich średniej i wyrażasz każdy punkt jako liczbę odchyleń standardowych od tej średniej.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
StandardScalerz modułupreprocessingbibliotekisklearn. - Utwórz instancję
StandardScaler()i przypisz ją do zmiennejSS_scaler. - Dopasuj
StandardScalerdo kolumnyAgeze zbioruso_numeric_df. - Przekształć tę samą kolumnę za pomocą dopasowanego skalera.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import StandardScaler
____
# Instantiate StandardScaler
SS_scaler = ____()
# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())