Škálování dat
U ML algoritmů pracujících s metrikami vzdálenosti je škálování dat naprosto zásadní – funkce s různými měřítky totiž výsledky zkreslují. K-means využívá euklidovskou vzdálenost při měření vzdálenosti k centroidům clusterů, takže před implementací algoritmu je potřeba data nejprve škálovat. Pojďme to udělat jako první.
K dispozici máš dataframe df z předchozího cvičení, který prošel drobnou přípravou a je připravený k použití se sklearn. Labely pro podvody jsou samostatně uloženy v proměnné labels – použij je later ke kontrole výsledků. numpy je importován jako np.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Importuj
MinMaxScaler. - Převeď dataframe
dfna numpy poleXtak, že vezmeš pouze hodnoty zdfa zajistíš, že jsou všechny hodnoty typufloat. - Aplikuj definovaný scaler na
X, aby ses získal/a škálované hodnotyX_scaled, které přenesou všechny příznaky na škálu 0–1.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)