Skalning av data
För maskininlärningsalgoritmer som använder avståndsbaserade mätvärden är det avgörande att alltid skala dina data, eftersom särdrag med olika skalor kan förvränga resultaten. K-means använder det euklidiska avståndet för att mäta avståndet till klustercentroider, så du behöver skala datan innan du fortsätter att implementera algoritmen. Låt oss göra det först.
Tillgänglig är dataramen df från föregående övning, med viss mindre databearbetning utförd så att den är redo att användas med sklearn. Bedrägerietiketterna lagras separat under labels – du kan använda dem för att kontrollera resultaten senare. numpy har importerats som np.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
- Importera
MinMaxScaler. - Omvandla din dataram
dftill en numpy-arrayXgenom att ta ut enbart värdena fråndfoch se till att alla värden är av typenfloat. - Applicera den definierade skalaren på
Xför att få de skalade värdena iX_scaled, vilket tvingar alla dina särdrag till en 0–1-skala.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)