Kom igångKom igång gratis

Öva på standardisering

Det är riskabelt att använda KNN på okända fördelningar utan förberedelse. Prestandan försämras kraftigt när featuredistributionerna inte har samma skala. Oskalade features snedvrider avståndsuträkningar och ger därmed orealistiska anomalipoäng.

En vanlig metod för att motverka detta är standardisering, som innebär att medelvärdet tas bort från en feature och att den divideras med standardavvikelsen. Resultatet är att featuren får medelvärdet 0 och variansen 1.

Öva på standardisering med datamängden females, som redan har laddats in åt dig.

Den här övningen är en del av kursen

Avvikelsedetektering i Python

Visa kurs

Övningsinstruktioner

  • Skapa en instans av StandardScaler() och lagra den som ss.
  • Extrahera feature- och målmatriser till X och y. Målvariabeln är kolumnen weightkg.
  • Anpassa StandardScaler() till X och transformera den simultant.
  • Upprepa processen ovan, men bevara kolumnnamnen i X-DataFrame:en.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from sklearn.preprocessing import StandardScaler

# Initialize a StandardScaler
ss = ____

# Extract feature and target arrays
X = ____ 
y = ____

# Fit/transform X
X_transformed = ____

# Fit/transform X but preserve the column names
X.____ = ____
Redigera och kör kod