Exersând standardizarea
Folosirea KNN pe distribuții necunoscute fără pregătire prealabilă poate fi riscantă. Performanța sa scade semnificativ atunci când distribuțiile caracteristicilor nu au aceleași scări. Caracteristicile nescalate distorsionează calculele de distanță și returnează scoruri de anomalie nerealiste.
O tehnică comună pentru a contracara acest lucru este standardizarea, care presupune eliminarea mediei dintr-o caracteristică și împărțirea la abaterea standard. Aceasta face ca acea caracteristică să aibă media 0 și varianța 1.
Exersează standardizarea pe setul de date females, care a fost deja încărcat pentru tine.
Acest exercițiu face parte din cursul
Detecția anomaliilor în Python
Instrucțiuni pentru exercițiu
- Creează o instanță a
StandardScaler()și stocheaz-o în variabilass. - Extrage matricele de caracteristici și de țintă în
Xșiy. Ținta este coloanaweightkg. - Antrenează
StandardScaler()pe X și transformă-l simultan. - Repetă procesul de mai sus, dar păstrează numele coloanelor din DataFrame-ul
X.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.preprocessing import StandardScaler
# Initialize a StandardScaler
ss = ____
# Extract feature and target arrays
X = ____
y = ____
# Fit/transform X
X_transformed = ____
# Fit/transform X but preserve the column names
X.____ = ____