Використання статистики для визначення нормальної поведінки
У попередніх вправах ми побачили, що шахрайство частіше трапляється в окремих категоріях транзакцій, однак очевидного способу сегментувати дані, наприклад за віком, немає. Тепер дослідмо середні суми витрат у звичайних і шахрайських транзакціях. Це дасть вам розуміння того, як шахрайські транзакції структурно відрізняються від звичайних.
Ця вправа є частиною курсу
Виявлення шахрайства в Python
Інструкції до вправи
- Створіть два нові датафрейми для спостережень із шахрайством і без нього. Знайдіть потрібні рядки в
dfза допомогою.locі задайте умови «де fraud дорівнює 1» та «де fraud дорівнює 0» для створення нових датафреймів. - Побудуйте гістограми для стовпця
amountу щойно створених датафреймах і призначте міткиfraudтаnonfraudвідповідно для графіків.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create two dataframes with fraud and non-fraud data
df_fraud = df.____[df.____ == ____]
df_non_fraud = df.____[df.____ == ____]
# Plot histograms of the amounts in fraud and non-fraud data
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()