Zacznij terazZacznij za darmo

Skalowanie danych

W algorytmach uczenia maszynowego opartych na metrykach odległości skalowanie danych jest absolutnie konieczne – cechy wyrażone w różnych skalach mogą zaburzać wyniki. K-means wyznacza odległości do centroidów klastrów przy użyciu odległości euklidesowej, dlatego przed wdrożeniem algorytmu należy najpierw przeskalować dane. Zajmijmy się tym teraz.

Dostępna jest ramka danych df z poprzedniego ćwiczenia, po wstępnym przygotowaniu – gotowa do użycia z biblioteką sklearn. Etykiety wskazujące na oszustwo są przechowywane osobno w zmiennej labels – możesz ich użyć później do sprawdzenia wyników. Biblioteka numpy została zaimportowana jako np.

To ćwiczenie jest częścią kursu

Wykrywanie oszustw w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj MinMaxScaler.
  • Przekształć ramkę danych df w tablicę numpy X, pobierając same wartości z df – upewnij się, że wszystkie są typu float.
  • Zastosuj zdefiniowany scaler na tablicy X, aby uzyskać przeskalowane wartości X_scaled i sprowadzić wszystkie cechy do skali 0–1.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
Edytuj i uruchom kod