НачатьНачать бесплатно

Использование статистики для определения нормального поведения

В предыдущих упражнениях мы выяснили, что мошенничество чаще встречается в определённых категориях транзакций, однако очевидного способа разбить данные на группы, например по возрасту, не нашлось. На этот раз давайте исследуем средние суммы обычных и мошеннических транзакций. Это поможет понять, чем мошеннические транзакции структурно отличаются от нормальных.

Это упражнение является частью курса

Обнаружение мошенничества на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте два новых датафрейма: один для мошеннических, другой для обычных транзакций. Используйте .loc для фильтрации данных из df: задайте условие «там, где fraud равно 1» и «там, где fraud равно 0».
  • Постройте гистограммы на основе столбца amount для каждого из новых датафреймов и присвойте им метки fraud и nonfraud соответственно.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create two dataframes with fraud and non-fraud data 
df_fraud = df.____[df.____ == ____] 
df_non_fraud = df.____[df.____ == ____]

# Plot histograms of the amounts in fraud and non-fraud data 
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()
Редактировать и запускать код