Predicția probabilității de nerambursare
Procesarea datelor este completă și a venit momentul să generezi predicții pentru probabilitatea de nerambursare. Vei antrena un model LogisticRegression() pe date și vei analiza cum prezice acesta probabilitatea de nerambursare.
Pentru a înțelege mai bine ce produce modelul cu predict_proba, aruncă o privire asupra unui exemplu de înregistrare alături de probabilitatea de nerambursare prezisă. Cum arată primele cinci predicții comparativ cu valorile reale ale loan_status?
Setul de date cr_loan_prep, împreună cu X_train, X_test, y_train și y_test, au fost deja încărcate în spațiul de lucru.
Acest exercițiu face parte din cursul
Modelarea Riscului de Credit în Python
Instrucțiuni pentru exercițiu
- Antrenează un model de regresie logistică pe datele de antrenament și salvează-l în variabila
clf_logistic. - Folosește
predict_proba()pe datele de testare pentru a genera predicțiile și stochează-le înpreds. - Creează două cadre de date,
preds_dfșitrue_df, pentru a stoca primele cinci predicții și, respectiv, valorile reale aleloan_status. - Afișează
true_dfșipreds_dfîmpreună, folosind.concat().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))