Öva på standardisering
Det är riskabelt att använda KNN på okända fördelningar utan förberedelse. Prestandan försämras kraftigt när featuredistributionerna inte har samma skala. Oskalade features snedvrider avståndsuträkningar och ger därmed orealistiska anomalipoäng.
En vanlig metod för att motverka detta är standardisering, som innebär att medelvärdet tas bort från en feature och att den divideras med standardavvikelsen. Resultatet är att featuren får medelvärdet 0 och variansen 1.
Öva på standardisering med datamängden females, som redan har laddats in åt dig.
Den här övningen är en del av kursen
Avvikelsedetektering i Python
Övningsinstruktioner
- Skapa en instans av
StandardScaler()och lagra den somss. - Extrahera feature- och målmatriser till
Xochy. Målvariabeln är kolumnenweightkg. - Anpassa
StandardScaler()till X och transformera den simultant. - Upprepa processen ovan, men bevara kolumnnamnen i
X-DataFrame:en.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.preprocessing import StandardScaler
# Initialize a StandardScaler
ss = ____
# Extract feature and target arrays
X = ____
y = ____
# Fit/transform X
X_transformed = ____
# Fit/transform X but preserve the column names
X.____ = ____