Standardisering
Normalisering kan vara användbart för att skala en kolumn mellan två datapunkter, men det är svårt att jämföra två skalade kolumner om någon av dem påverkas kraftigt av extremvärden. En vanlig lösning på detta är standardisering. I stället för att använda fasta övre och nedre gränser centrerar du datan kring sitt medelvärde och beräknar hur många standardavvikelser varje datapunkt befinner sig från medelvärdet.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Importera
StandardScalerfrånsklearns modulpreprocessing. - Skapa en instans av
StandardScaler()och spara den somSS_scaler. - Anpassa
StandardScalerpå kolumnenAgeiso_numeric_df. - Transformera samma kolumn med den skalare du just anpassade.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import StandardScaler
____
# Instantiate StandardScaler
SS_scaler = ____()
# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())