Procvičování standardizace
Používat KNN na neznámých distribucích naslepo je riskantní. Jeho výkon výrazně klesá, když příznaky nemají stejné měřítko. Neškálované příznaky zkreslují výpočty vzdáleností, a tím vracejí nerealistické skóre anomálií.
Běžnou technikou, jak tomuto problému předejít, je standardizace – tedy odečtení průměru od příznaku a vydělení jeho směrodatnou odchylkou. Výsledkem je příznak s průměrem 0 a rozptylem 1.
Procvič si standardizaci na datasetu females, který je již načtený.
Toto cvičení je součástí kurzu
Detekce anomálií v Pythonu
Pokyny k cvičení
- Vytvoř instanci
StandardScaler()a ulož ji jakoss. - Extrahuj pole příznaků a cílové proměnné do
Xay. Cílová proměnná je sloupecweightkg. - Přizpůsob
StandardScaler()na X a zároveň ho transformuj. - Zopakuj výše uvedený postup, ale zachovej přitom názvy sloupců DataFrame
X.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.preprocessing import StandardScaler
# Initialize a StandardScaler
ss = ____
# Extract feature and target arrays
X = ____
y = ____
# Fit/transform X
X_transformed = ____
# Fit/transform X but preserve the column names
X.____ = ____