Перевірка результатів
У цій вправі ви будете перевіряти результати своєї моделі виявлення шахрайства DBSCAN. На практиці надійних міток часто немає, і тут допоможе аналітик з протидії шахрайству, який зможе підтвердити результати. Він або вона перевірить ваші висновки та подивиться, чи справді позначені вами випадки підозрілі. Ви також можете звіритися з історично відомими випадками шахрайства й подивитися, чи ваша модель їх позначає.
У цьому завданні ви використаєте мітки шахрайства, щоб перевірити результати своєї моделі. Прогнозовані номери кластерів доступні в pred_labels, а початкові мітки шахрайства — у labels.
Ця вправа є частиною курсу
Виявлення шахрайства в Python
Інструкції до вправи
- Створіть датафрейм, що поєднує номери кластерів із фактичними мітками. Це вже зроблено за вас.
- Створіть умову, яка позначає шахрайство для трьох найменших кластерів: кластерів 21, 17 і 9.
- Створіть перехресну таблицю з фактичних міток шахрайства та щойно створених прогнозованих міток шахрайства.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a dataframe of the predicted cluster numbers and fraud labels
df = pd.DataFrame({'clusternr':pred_labels,'fraud':labels})
# Create a condition flagging fraud for the smallest clusters
df['predicted_fraud'] = np.where((df['clusternr']==21)|(____)|(____),1 , 0)
# Run a crosstab on the results
print(pd.crosstab(df['fraud'], df['____'], rownames=['Actual Fraud'], colnames=['Flagged Fraud']))