Verilerini görselleştirme
Önceki egzersizden sahtekarlık (fraud) ile sahtekarlık olmayan gözlemler arasındaki oranın çok düşük olduğunu biliyoruz. Bunun için, verimizi yeniden örnekleyerek (re-sampling) bir şeyler yapabiliriz; bu konu bir sonraki videoda açıklanıyor.
Bu egzersizde veriye bakacak ve sahtekarlık ile sahtekarlık olmayan oranını görselleştireceksin. Sahtekarlık analizi yaparken, verini değiştirmeden önce önce bir göz atmak her zaman iyi bir başlangıçtır.
Ayrıca, ekip arkadaşlarınla konuşurken, bir görsel genellikle aşırı dengesiz bir veriyle uğraştığını çok net gösterir.
Hadi, df veri kümesindeki sahtekarlık ve sahtekarlık olmayan veri noktalarının oranını görselleştiren bir grafik oluşturalım.
prep_data() fonksiyonu ve matplotlib.pyplot modülü plt olarak çalışma alanında yüklü durumdadır.
Bu egzersiz, kursun bir parçasıdır
Python ile Sahtekarlık Tespiti
Egzersiz talimatları
plot_data(X, y)fonksiyonunu tanımla; bu fonksiyon verilen özellik kümesiXile etiketleriyyi bir saçılım grafiğinde düzgün bir şekilde çizer. Bu senin için yapıldı.Özellik kümesi
Xve etiketleryyi oluşturmak içindfveri kümendeprep_data()fonksiyonunu kullan.Elde ettiğin yeni
Xveyüzerindeplot_data()fonksiyonunu çalıştırarak sonuçlarını görselleştir.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)