ÎncepețiÎncepe gratuit

Exersând standardizarea

Folosirea KNN pe distribuții necunoscute fără pregătire prealabilă poate fi riscantă. Performanța sa scade semnificativ atunci când distribuțiile caracteristicilor nu au aceleași scări. Caracteristicile nescalate distorsionează calculele de distanță și returnează scoruri de anomalie nerealiste.

O tehnică comună pentru a contracara acest lucru este standardizarea, care presupune eliminarea mediei dintr-o caracteristică și împărțirea la abaterea standard. Aceasta face ca acea caracteristică să aibă media 0 și varianța 1.

Exersează standardizarea pe setul de date females, care a fost deja încărcat pentru tine.

Acest exercițiu face parte din cursul

Detecția anomaliilor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează o instanță a StandardScaler() și stocheaz-o în variabila ss.
  • Extrage matricele de caracteristici și de țintă în X și y. Ținta este coloana weightkg.
  • Antrenează StandardScaler() pe X și transformă-l simultan.
  • Repetă procesul de mai sus, dar păstrează numele coloanelor din DataFrame-ul X.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.preprocessing import StandardScaler

# Initialize a StandardScaler
ss = ____

# Extract feature and target arrays
X = ____ 
y = ____

# Fit/transform X
X_transformed = ____

# Fit/transform X but preserve the column names
X.____ = ____
Editează și rulează codul