Förutsäga sannolikheten för fallissemang
All databearbetning är klar och det är dags att börja skapa förutsägelser för sannolikheten för fallissemang. Du ska träna en LogisticRegression()-modell på datan och undersöka hur den förutsäger sannolikheten för fallissemang.
För att bättre förstå vad modellen producerar med predict_proba bör du titta på ett exempelobjekt tillsammans med den förutsagda sannolikheten för fallissemang. Hur ser de fem första förutsägelserna ut jämfört med de faktiska värdena för loan_status?
Datamängden cr_loan_prep samt X_train, X_test, y_train och y_test har redan laddats in i arbetsmiljön.
Den här övningen är en del av kursen
Kreditriskmodellering i Python
Övningsinstruktioner
- Träna en logistisk regressionsmodell på träningsdatan och lagra den som
clf_logistic. - Använd
predict_proba()på testdatan för att skapa förutsägelserna och lagra dem ipreds. - Skapa två dataramar,
preds_dfochtrue_df, för att lagra de fem första förutsägelserna och de sanna värdena förloan_status. - Skriv ut
true_dfochpreds_dfsom en gemensam tabell med.concat().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))