Zacznij terazZacznij za darmo

Metryki wydajności modelu lasu losowego

W poprzednich ćwiczeniach uzyskałeś wynik dokładności dla modelu lasu losowego. Tym razem warto wiedzieć, że dokładność może być myląca w przypadku wykrywania oszustw. Przy silnie niezrównoważonych danych dotyczących fraudów krzywa AUROC jest bardziej wiarygodną metryką wydajności, służącą do porównywania różnych klasyfikatorów. Ponadto raport klasyfikacji informuje o precyzji i czułości modelu, natomiast macierz pomyłek pokazuje, ile przypadków oszustw udaje się poprawnie przewidzieć. Czas zatem wyznaczyć te metryki.

Będziesz kontynuować pracę z tym samym modelem lasu losowego z poprzedniego ćwiczenia. Model zdefiniowany jako model = RandomForestClassifier(random_state=5) został już dopasowany do danych treningowych, a zmienne X_train, y_train, X_test, y_test są dostępne.

To ćwiczenie jest częścią kursu

Wykrywanie oszustw w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj raport klasyfikacji, macierz pomyłek i wynik ROC z sklearn.metrics.
  • Pobierz binarne predykcje z wytrenowanego modelu lasu losowego model.
  • Uzyskaj przewidywane prawdopodobieństwa, wywołując funkcję predict_proba().
  • Wyznacz raport klasyfikacji i macierz pomyłek, porównując y_test z predicted.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the packages to get the different performance metrics
from sklearn.metrics import ____, ____, ____

# Obtain the predictions from our random forest model 
predicted = model.____(X_test)

# Predict probabilities
probs = ____.____(X_test)

# Print the ROC curve, classification report and confusion matrix
print(____(y_test, probs[:,1]))
print(____(____, predicted))
print(____(____, ____))
Edytuj i uruchom kod