Kom igångKom igång gratis

Standardisering

Normalisering kan vara användbart för att skala en kolumn mellan två datapunkter, men det är svårt att jämföra två skalade kolumner om någon av dem påverkas kraftigt av extremvärden. En vanlig lösning på detta är standardisering. I stället för att använda fasta övre och nedre gränser centrerar du datan kring sitt medelvärde och beräknar hur många standardavvikelser varje datapunkt befinner sig från medelvärdet.

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Importera StandardScaler från sklearns modul preprocessing.
  • Skapa en instans av StandardScaler() och spara den som SS_scaler.
  • Anpassa StandardScaler på kolumnen Age i so_numeric_df.
  • Transformera samma kolumn med den skalare du just anpassade.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
Redigera och kör kod