Использование статистики для определения нормального поведения
В предыдущих упражнениях мы выяснили, что мошенничество чаще встречается в определённых категориях транзакций, однако очевидного способа разбить данные на группы, например по возрасту, не нашлось. На этот раз давайте исследуем средние суммы обычных и мошеннических транзакций. Это поможет понять, чем мошеннические транзакции структурно отличаются от нормальных.
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Создайте два новых датафрейма: один для мошеннических, другой для обычных транзакций. Используйте
.locдля фильтрации данных изdf: задайте условие «там, где fraud равно 1» и «там, где fraud равно 0». - Постройте гистограммы на основе столбца
amountдля каждого из новых датафреймов и присвойте им меткиfraudиnonfraudсоответственно.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create two dataframes with fraud and non-fraud data
df_fraud = df.____[df.____ == ____]
df_non_fraud = df.____[df.____ == ____]
# Plot histograms of the amounts in fraud and non-fraud data
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()