Kom igångKom igång gratis

Skalning av data

För maskininlärningsalgoritmer som använder avståndsbaserade mätvärden är det avgörande att alltid skala dina data, eftersom särdrag med olika skalor kan förvränga resultaten. K-means använder det euklidiska avståndet för att mäta avståndet till klustercentroider, så du behöver skala datan innan du fortsätter att implementera algoritmen. Låt oss göra det först.

Tillgänglig är dataramen df från föregående övning, med viss mindre databearbetning utförd så att den är redo att användas med sklearn. Bedrägerietiketterna lagras separat under labels – du kan använda dem för att kontrollera resultaten senare. numpy har importerats som np.

Den här övningen är en del av kursen

Bedrägeridetektering i Python

Visa kurs

Övningsinstruktioner

  • Importera MinMaxScaler.
  • Omvandla din dataram df till en numpy-array X genom att ta ut enbart värdena från df och se till att alla värden är av typen float.
  • Applicera den definierade skalaren på X för att få de skalade värdena i X_scaled, vilket tvingar alla dina särdrag till en 0–1-skala.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
Redigera och kör kod