Zacznij terazZacznij za darmo

Standaryzacja

Normalizacja sprawdza się przy skalowaniu kolumny do określonego przedziału, ale porównywanie dwóch znormalizowanych kolumn staje się trudne, gdy choćby jedna z nich jest silnie zaburzona przez wartości odstające. Popularnym rozwiązaniem tego problemu jest standaryzacja – zamiast wyznaczać sztywne granice, centujesz dane wokół ich średniej i wyrażasz każdy punkt jako liczbę odchyleń standardowych od tej średniej.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj StandardScaler z modułu preprocessing biblioteki sklearn.
  • Utwórz instancję StandardScaler() i przypisz ją do zmiennej SS_scaler.
  • Dopasuj StandardScaler do kolumny Age ze zbioru so_numeric_df.
  • Przekształć tę samą kolumnę za pomocą dopasowanego skalera.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
Edytuj i uruchom kod