Kom igångKom igång gratis

Kostnadsanalys i verkligheten

Du arbetar fortfarande med kreditdatamängden i den här övningen. Kom ihåg att ett "positivt" resultat i denna datamängd innebär "dålig kredit", det vill säga en kund som inte betalade sitt lån, och ett "negativt" innebär en kund som fortsatte att betala utan problem. Bankens chef har informerat dig om att banken i genomsnitt tjänar 100 000 kr på varje kund med "låg risk", men förlorar 1 500 000 kr på varje kund med "hög risk". Din algoritm används för att granska lånesökande: de som klassificeras som "negativa" beviljas lån, medan de som klassificeras som "positiva" nekas. Vad är den totala kostnaden för din klassificerare? Data finns tillgänglig som X_train, X_test, y_train och y_test. Funktionerna confusion_matrix(), f1_score(), precision_score() och RandomForestClassifier() är tillgängliga.

Den här övningen är en del av kursen

Att designa maskininlärningsflöden i Python

Visa kurs

Övningsinstruktioner

  • Träna en random forest-klassificerare på träningsdata.
  • Använd den för att etikettera testdata.
  • Extrahera de falska negativen och de falska positiverna från confusion_matrix(). Du behöver platta ut matrisen.
  • Att felaktigt klassificera en "bra" kund som "dålig" innebär att banken går miste om 100 000 kr i vinst. Att felaktigt klassificera en "dålig" kund som "bra" innebär att banken förlorar 1 500 000 kr på grund av att kunden inte betalar sitt lån.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Fit a random forest classifier to the training data
clf = ____(random_state=2).fit(____, ____)

# Label the test data
preds = clf.____(____)

# Get false positives/negatives from the confusion matrix
tn, ____, ____, tp = confusion_matrix(y_test, preds).____()

# Now compute the cost using the manager's advice
cost = fp*____ + fn*____
Redigera och kör kod