Kontrola výsledků
V tomto cvičení zkontrololuješ výsledky svého modelu pro detekci podvodů pomocí DBSCAN. V praxi spolehlivé štítky (labels) často nemáš k dispozici — a právě tady ti může pomoci fraud analytik, který ověří, zda jsou případy, jež jsi označil/a jako podezřelé, skutečně problematické. Můžeš také porovnat výsledky s historicky známými případy podvodů a zjistit, zda je tvůj model správně zachytil.
V tomto případě použiješ fraud labels k ověření výsledků modelu. Predikovaná čísla clusterů jsou dostupná pod pred_labels a původní fraud labels pod labels.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Vytvoř dataframe kombinující čísla clusterů se skutečnými labels. Tento krok už byl hotový za tebe.
- Vytvoř podmínku, která označí podvod pro tři nejmenší clustery: clustery 21, 17 a 9.
- Vytvoř crosstab ze skutečných fraud labels a nově vytvořených predikovaných fraud labels.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a dataframe of the predicted cluster numbers and fraud labels
df = pd.DataFrame({'clusternr':pred_labels,'fraud':labels})
# Create a condition flagging fraud for the smallest clusters
df['predicted_fraud'] = np.where((df['clusternr']==21)|(____)|(____),1 , 0)
# Run a crosstab on the results
print(pd.crosstab(df['fraud'], df['____'], rownames=['Actual Fraud'], colnames=['Flagged Fraud']))