Standardizace
Normalizace se hodí pro škálování sloupce mezi dvěma hodnotami, ale pokud je alespoň jeden ze škálovaných sloupců výrazně ovlivněn odlehlými hodnotami, vzájemné porovnání se stává obtížným. Častým řešením je standardizace – místo pevných mezí se data vycentrují kolem průměru a pro každý datový bod se určí, kolik směrodatných odchylek leží od tohoto průměru.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Importuj
StandardScalerz modulupreprocessingknihovnysklearn. - Vytvoř instanci
StandardScaler()a ulož ji do proměnnéSS_scaler. - Natrénuj
StandardScalerna sloupciAgezso_numeric_df. - Transformuj stejný sloupec pomocí právě natrénovaného scaleru.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import StandardScaler
____
# Instantiate StandardScaler
SS_scaler = ____()
# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())