ÎncepețiÎncepe gratuit

Standardizarea

Deși normalizarea poate fi utilă pentru scalarea unei coloane între două valori, este dificil să compari două coloane scalate dacă cel puțin una dintre ele este puternic influențată de valori extreme (outlieri). O soluție des folosită în astfel de situații este standardizarea: în loc să impui o limită superioară și una inferioară stricte, centrezi datele în jurul mediei și calculezi numărul de abateri standard față de medie pentru fiecare punct de date.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă StandardScaler din modulul preprocessing al bibliotecii sklearn.
  • Inițializează StandardScaler() ca SS_scaler.
  • Antrenează StandardScaler pe coloana Age din so_numeric_df.
  • Transformă aceeași coloană folosind scalarul pe care tocmai l-ai antrenat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
Editează și rulează codul