Skalowanie danych
W algorytmach uczenia maszynowego opartych na metrykach odległości skalowanie danych jest absolutnie konieczne – cechy wyrażone w różnych skalach mogą zaburzać wyniki. K-means wyznacza odległości do centroidów klastrów przy użyciu odległości euklidesowej, dlatego przed wdrożeniem algorytmu należy najpierw przeskalować dane. Zajmijmy się tym teraz.
Dostępna jest ramka danych df z poprzedniego ćwiczenia, po wstępnym przygotowaniu – gotowa do użycia z biblioteką sklearn. Etykiety wskazujące na oszustwo są przechowywane osobno w zmiennej labels – możesz ich użyć później do sprawdzenia wyników. Biblioteka numpy została zaimportowana jako np.
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
MinMaxScaler. - Przekształć ramkę danych
dfw tablicę numpyX, pobierając same wartości zdf– upewnij się, że wszystkie są typufloat. - Zastosuj zdefiniowany scaler na tablicy
X, aby uzyskać przeskalowane wartościX_scaledi sprowadzić wszystkie cechy do skali 0–1.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)