ÎncepețiÎncepe gratuit

Predicția probabilității de nerambursare

Procesarea datelor este completă și a venit momentul să generezi predicții pentru probabilitatea de nerambursare. Vei antrena un model LogisticRegression() pe date și vei analiza cum prezice acesta probabilitatea de nerambursare.

Pentru a înțelege mai bine ce produce modelul cu predict_proba, aruncă o privire asupra unui exemplu de înregistrare alături de probabilitatea de nerambursare prezisă. Cum arată primele cinci predicții comparativ cu valorile reale ale loan_status?

Setul de date cr_loan_prep, împreună cu X_train, X_test, y_train și y_test, au fost deja încărcate în spațiul de lucru.

Acest exercițiu face parte din cursul

Modelarea Riscului de Credit în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Antrenează un model de regresie logistică pe datele de antrenament și salvează-l în variabila clf_logistic.
  • Folosește predict_proba() pe datele de testare pentru a genera predicțiile și stochează-le în preds.
  • Creează două cadre de date, preds_df și true_df, pentru a stoca primele cinci predicții și, respectiv, valorile reale ale loan_status.
  • Afișează true_df și preds_df împreună, folosind .concat().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))

# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)

# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()

# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))
Editează și rulează codul