Sahtekarlığı yakalamanın geleneksel yolunu keşfetmek
Bu egzersizde, kredi kartı veri kümemizde sahtekarlık vakalarını "eski usul" bulmayı deneyeceksin. Önce yaygın istatistikleri kullanarak eşik değerleri tanımlayacak, böylece sahtekarlık ve sahtekarlık olmayanları ayıracaksın. Ardından, bu eşikleri özelliklerine uygulayıp sahtekarlığı tespit edeceksin. Bu yaklaşım, fraud analitiği ekiplerinde oldukça yaygın.
İstatistiksel eşikler genellikle gözlemlerin ortalama değerlerine bakılarak belirlenir. Bu egzersize, özelliklerin ortalamaları sahtekarlık ve sahtekarlık olmayan vakalar arasında farklı mı diye kontrol ederek başlayalım. Sonra, bu bilgiyi kullanarak sağduyuya dayalı eşikler oluşturacaksın. En sonunda da bunun sahtekarlık tespitinde ne kadar iyi çalıştığını ölçeceksin.
pandas zaten pd olarak içe aktarılmış durumda.
Bu egzersiz, kursun bir parçasıdır
Python ile Sahtekarlık Tespiti
Egzersiz talimatları
groupby()kullanarakdf'iClassüzerinde grupla ve özelliklerin ortalamasını elde et.- Sahtekarlık vakalarını işaretlemek için, koşul olarak
V1-3'ten küçük veV3-5'ten küçük olacak şekilde bir koşul oluştur. - Performansı ölçmek için, işaretlenen sahtekarlık vakalarını gerçek sahtekarlık vakalarıyla karşılaştırmak üzere
pandasiçindekicrosstabfonksiyonunu kullan.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Get the mean for each group
____.____(____).mean()
# Implement a rule for stating which cases are flagged as fraud
df['flag_as_fraud'] = np.where(np.logical_and(______), 1, 0)
# Create a crosstab of flagged fraud cases versus the actual fraud cases
print(____(df.Class, df.flag_as_fraud, rownames=['Actual Fraud'], colnames=['Flagged Fraud']))