Zacznij terazZacznij za darmo

Analiza kosztów w praktyce

W tym ćwiczeniu nadal pracujesz na zbiorze danych dotyczących kredytów. Przypomnij sobie, że „pozytywny" wynik w tym zbiorze oznacza „zły kredyt", czyli klienta, który nie spłacił pożyczki, a „negatywny" – klienta, który regulował zobowiązania bez problemów. Menedżer banku poinformował cię, że bank zarabia średnio 10 tys. na każdym kliencie „niskiego ryzyka", ale traci 150 tys. na każdym kliencie „wysokiego ryzyka". Twój algorytm posłuży do oceny wnioskodawców: osoby zaklasyfikowane jako „negatywne" otrzymają pożyczkę, a „pozytywne" – zostaną odrzucone. Jaki jest całkowity koszt działania twojego klasyfikatora? Dane są dostępne jako X_train, X_test, y_train i y_test. Dostępne są funkcje confusion_matrix(), f1_score(), precision_score() oraz RandomForestClassifier().

To ćwiczenie jest częścią kursu

Projektowanie przepływów pracy uczenia maszynowego w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Dopasuj klasyfikator lasu losowego do danych treningowych.
  • Użyj go do przypisania etykiet danym testowym.
  • Wyodrębnij fałszywe przeoczenia i fałszywe alarmy z macierzy pomyłek zwróconej przez confusion_matrix(). Będziesz musiał(-a) spłaszczyć tę macierz.
  • Błędne zaklasyfikowanie klienta „dobrego" jako „złego" oznacza, że bank straciłby okazję do zarobienia 10 tys. Błędne zaklasyfikowanie klienta „złego" jako „dobrego" oznacza, że bank straciłby 150 tys. w wyniku niespłacenia pożyczki przez tego klienta.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Fit a random forest classifier to the training data
clf = ____(random_state=2).fit(____, ____)

# Label the test data
preds = clf.____(____)

# Get false positives/negatives from the confusion matrix
tn, ____, ____, tp = confusion_matrix(y_test, preds).____()

# Now compute the cost using the manager's advice
cost = fp*____ + fn*____
Edytuj i uruchom kod