Verileri ölçekleme
Mesafe tabanlı metrikler kullanan ML algoritmalarında, özelliklerin farklı ölçeklerde olması sonuçlarını bozacağı için verilerini HER ZAMAN ölçeklemen çok önemlidir. K-means, küme merkezlerine olan uzaklığı hesaplamak için Öklidyen mesafeyi kullanır; bu yüzden algoritmayı uygulamaya devam etmeden önce verilerini ölçeklemen gerekir. Hadi önce bunu yapalım.
Bu egzersizde, önceki egzersizden gelen ve sklearn ile kullanıma hazır hâle getirilmesi için küçük hazırlıklar yapılmış df veri çerçevesi mevcut. Sahtekârlık etiketleri labels altında ayrı olarak saklanıyor; sonuçları daha sonra kontrol etmek için bunları kullanabilirsin. numpy np takma adıyla içe aktarılmış durumda.
Bu egzersiz, kursun bir parçasıdır
Python ile Sahtekarlık Tespiti
Egzersiz talimatları
MinMaxScaler'ı içe aktar.dfveri çerçevesinin yalnızca değerlerini alarak onu bir numpy dizisiX'e dönüştür ve tüm değerlerinfloatolduğundan emin ol.- Tanımladığın ölçekleyiciyi
Xüzerine uygula ve tüm özelliklerini 0-1 aralığına zorlamak için ölçeklenmiş değerlerX_scaled'i elde et.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)