Začněte nyníZačněte zdarma

Procvičování standardizace

Používat KNN na neznámých distribucích naslepo je riskantní. Jeho výkon výrazně klesá, když příznaky nemají stejné měřítko. Neškálované příznaky zkreslují výpočty vzdáleností, a tím vracejí nerealistické skóre anomálií.

Běžnou technikou, jak tomuto problému předejít, je standardizace – tedy odečtení průměru od příznaku a vydělení jeho směrodatnou odchylkou. Výsledkem je příznak s průměrem 0 a rozptylem 1.

Procvič si standardizaci na datasetu females, který je již načtený.

Toto cvičení je součástí kurzu

Detekce anomálií v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř instanci StandardScaler() a ulož ji jako ss.
  • Extrahuj pole příznaků a cílové proměnné do X a y. Cílová proměnná je sloupec weightkg.
  • Přizpůsob StandardScaler() na X a zároveň ho transformuj.
  • Zopakuj výše uvedený postup, ale zachovej přitom názvy sloupců DataFrame X.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from sklearn.preprocessing import StandardScaler

# Initialize a StandardScaler
ss = ____

# Extract feature and target arrays
X = ____ 
y = ____

# Fit/transform X
X_transformed = ____

# Fit/transform X but preserve the column names
X.____ = ____
Upravit a spustit kód