Začněte nyníZačněte zdarma

Škálování dat

U ML algoritmů pracujících s metrikami vzdálenosti je škálování dat naprosto zásadní – funkce s různými měřítky totiž výsledky zkreslují. K-means využívá euklidovskou vzdálenost při měření vzdálenosti k centroidům clusterů, takže před implementací algoritmu je potřeba data nejprve škálovat. Pojďme to udělat jako první.

K dispozici máš dataframe df z předchozího cvičení, který prošel drobnou přípravou a je připravený k použití se sklearn. Labely pro podvody jsou samostatně uloženy v proměnné labels – použij je later ke kontrole výsledků. numpy je importován jako np.

Toto cvičení je součástí kurzu

Detekce podvodů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj MinMaxScaler.
  • Převeď dataframe df na numpy pole X tak, že vezmeš pouze hodnoty z df a zajistíš, že jsou všechny hodnoty typu float.
  • Aplikuj definovaný scaler na X, aby ses získal/a škálované hodnoty X_scaled, které přenesou všechny příznaky na škálu 0–1.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
Upravit a spustit kód