Analýza nákladů v praxi
V tomto cvičení budeme nadále pracovat s datasetem o úvěrech. Připomeň si, že „pozitivní" výsledek v tomto datasetu znamená „špatný úvěr", tedy zákazníka, který nesplatil půjčku, a „negativní" výsledek znamená zákazníka, který splácí bez problémů. Vedoucí banky tě informoval, že banka vydělá v průměru 10 000 na každém zákazníkovi s „dobrým rizikem", ale ztratí 150 000 na každém zákazníkovi se „špatným rizikem". Tvůj algoritmus bude sloužit ke schvalování žadatelů – ti, kteří budou označeni jako „negativní", úvěr dostanou, a ti označení jako „pozitivní" budou odmítnuti. Jaké jsou celkové náklady tvého klasifikátoru? Data jsou dostupná jako X_train, X_test, y_train a y_test. K dispozici jsou funkce confusion_matrix(), f1_score(), precision_score() a RandomForestClassifier().
Toto cvičení je součástí kurzu
Designing Machine Learning Workflows in Python
Pokyny k cvičení
- Natrénuj klasifikátor náhodného lesa na trénovacích datech.
- Použij ho k přiřazení štítků testovacím datům.
- Z
confusion_matrix()získej falešně negativní a falešně pozitivní výsledky. Matici bude potřeba zploštit. - Falešná klasifikace „dobrého" zákazníka jako „špatného" znamená, že banka přijde o příležitost vydělat 10 000. Falešná klasifikace „špatného" zákazníka jako „dobrého" znamená, že banka ztratí 150 000 kvůli nesplacení půjčky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit a random forest classifier to the training data
clf = ____(random_state=2).fit(____, ____)
# Label the test data
preds = clf.____(____)
# Get false positives/negatives from the confusion matrix
tn, ____, ____, tp = confusion_matrix(y_test, preds).____()
# Now compute the cost using the manager's advice
cost = fp*____ + fn*____