Začněte nyníZačněte zdarma

Analýza nákladů v praxi

V tomto cvičení budeme nadále pracovat s datasetem o úvěrech. Připomeň si, že „pozitivní" výsledek v tomto datasetu znamená „špatný úvěr", tedy zákazníka, který nesplatil půjčku, a „negativní" výsledek znamená zákazníka, který splácí bez problémů. Vedoucí banky tě informoval, že banka vydělá v průměru 10 000 na každém zákazníkovi s „dobrým rizikem", ale ztratí 150 000 na každém zákazníkovi se „špatným rizikem". Tvůj algoritmus bude sloužit ke schvalování žadatelů – ti, kteří budou označeni jako „negativní", úvěr dostanou, a ti označení jako „pozitivní" budou odmítnuti. Jaké jsou celkové náklady tvého klasifikátoru? Data jsou dostupná jako X_train, X_test, y_train a y_test. K dispozici jsou funkce confusion_matrix(), f1_score(), precision_score() a RandomForestClassifier().

Toto cvičení je součástí kurzu

Designing Machine Learning Workflows in Python

Zobrazit kurz

Pokyny k cvičení

  • Natrénuj klasifikátor náhodného lesa na trénovacích datech.
  • Použij ho k přiřazení štítků testovacím datům.
  • Z confusion_matrix() získej falešně negativní a falešně pozitivní výsledky. Matici bude potřeba zploštit.
  • Falešná klasifikace „dobrého" zákazníka jako „špatného" znamená, že banka přijde o příležitost vydělat 10 000. Falešná klasifikace „špatného" zákazníka jako „dobrého" znamená, že banka ztratí 150 000 kvůli nesplacení půjčky.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Fit a random forest classifier to the training data
clf = ____(random_state=2).fit(____, ____)

# Label the test data
preds = clf.____(____)

# Get false positives/negatives from the confusion matrix
tn, ____, ____, tp = confusion_matrix(y_test, preds).____()

# Now compute the cost using the manager's advice
cost = fp*____ + fn*____
Upravit a spustit kód