Ćwiczenie standaryzacji
Używanie KNN bez znajomości rozkładu danych może być ryzykowne. Algorytm działa znacznie gorzej, gdy cechy mają różne skale. Nieprzeliczone cechy zaburzają obliczenia odległości, co prowadzi do błędnych wyników anomalii.
Popularnym sposobem na rozwiązanie tego problemu jest standaryzacja: polega ona na odjęciu średniej od wartości cechy i podzieleniu wyniku przez odchylenie standardowe. Efektem jest cecha o średniej równej 0 i wariancji równej 1.
Przećwicz standaryzację na zbiorze danych females, który jest już wczytany.
To ćwiczenie jest częścią kursu
Wykrywanie anomalii w Pythonie
Instrukcje do ćwiczenia
- Utwórz instancję
StandardScaler()i zapisz ją jakoss. - Wyodrębnij tablice cech i zmienną docelową do
Xiy. Zmienną docelową jest kolumnaweightkg. - Dopasuj
StandardScaler()do X i jednocześnie przekształć dane. - Powtórz powyższy proces, zachowując tym razem nazwy kolumn z DataFrame
X.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.preprocessing import StandardScaler
# Initialize a StandardScaler
ss = ____
# Extract feature and target arrays
X = ____
y = ____
# Fit/transform X
X_transformed = ____
# Fit/transform X but preserve the column names
X.____ = ____