Metryki wydajności modelu lasu losowego
W poprzednich ćwiczeniach uzyskałeś wynik dokładności dla modelu lasu losowego. Tym razem warto wiedzieć, że dokładność może być myląca w przypadku wykrywania oszustw. Przy silnie niezrównoważonych danych dotyczących fraudów krzywa AUROC jest bardziej wiarygodną metryką wydajności, służącą do porównywania różnych klasyfikatorów. Ponadto raport klasyfikacji informuje o precyzji i czułości modelu, natomiast macierz pomyłek pokazuje, ile przypadków oszustw udaje się poprawnie przewidzieć. Czas zatem wyznaczyć te metryki.
Będziesz kontynuować pracę z tym samym modelem lasu losowego z poprzedniego ćwiczenia. Model zdefiniowany jako model = RandomForestClassifier(random_state=5) został już dopasowany do danych treningowych, a zmienne X_train, y_train, X_test, y_test są dostępne.
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj raport klasyfikacji, macierz pomyłek i wynik ROC z
sklearn.metrics. - Pobierz binarne predykcje z wytrenowanego modelu lasu losowego
model. - Uzyskaj przewidywane prawdopodobieństwa, wywołując funkcję
predict_proba(). - Wyznacz raport klasyfikacji i macierz pomyłek, porównując
y_testzpredicted.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the packages to get the different performance metrics
from sklearn.metrics import ____, ____, ____
# Obtain the predictions from our random forest model
predicted = model.____(X_test)
# Predict probabilities
probs = ____.____(X_test)
# Print the ROC curve, classification report and confusion matrix
print(____(y_test, probs[:,1]))
print(____(____, predicted))
print(____(____, ____))