Aykırı değerleri tespit etme
Sonraki egzersizlerde, K-means algoritmasını kullanarak sahtekarlık tahmini yapacak ve bu tahminleri, sonuçlarımızı kontrol etmek için kaydedilmiş gerçek etiketlerle karşılaştıracaksın.
Sahte işlemler genellikle küme merkezine en uzak gözlemler olarak işaretlenir. Bu egzersizde bunu nasıl yapacağını ve eşik değerini nasıl belirleyeceğini öğreneceksin. Sonraki egzersizde ise sonuçları kontrol edeceksin.
Elinde ölçeklenmiş gözlemler X_scaled ve y değişkeninde saklanan etiketler bulunuyor.
Bu egzersiz, kursun bir parçasıdır
Python ile Sahtekarlık Tespiti
Egzersiz talimatları
- Ölçeklenmiş veriyi ve etiketleri
yeğitim ve test kümelerine ayır. - 3 kümeli MiniBatch K-means modelini tanımla ve eğitim verisine uydur.
- Test verinden küme tahminlerini al ve küme merkezlerini elde et.
- Sahtekarlık ve sahte olmayan arasındaki sınırı, mesafe dağılımının %95 ve üzeri olacak şekilde tanımla.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Split the data into training and test set
X_train, X_test, y_train, y_test = ____(____, ____, test_size=0.3, random_state=0)
# Define K-means model
kmeans = ____(n_clusters=____, random_state=42).fit(____)
# Obtain predictions and calculate distance from cluster centroid
X_test_clusters = ____.____(X_test)
X_test_clusters_centers = ____.____
dist = [np.linalg.norm(x-y) for x, y in zip(X_test, X_test_clusters_centers[X_test_clusters])]
# Create fraud predictions based on outliers on clusters
km_y_pred = np.array(dist)
km_y_pred[dist >= np.percentile(dist, ____)] = 1
km_y_pred[dist < np.percentile(dist, ____)] = 0