Prognozowanie prawdopodobieństwa niewywiązania się ze zobowiązania
Przetwarzanie danych jest zakończone – czas przystąpić do tworzenia prognoz prawdopodobieństwa niewywiązania się ze zobowiązania. Wytrenuj model LogisticRegression() na danych i sprawdź, jak prognozuje to prawdopodobieństwo.
Aby lepiej zrozumieć, co zwraca predict_proba, porównaj przykładowy rekord z odpowiadającym mu prognozowanym prawdopodobieństwem. Jak wyglądają pierwsze pięć prognoz na tle rzeczywistych wartości loan_status?
Zbiór danych cr_loan_prep oraz zmienne X_train, X_test, y_train i y_test są już załadowane w środowisku roboczym.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w Pythonie
Instrukcje do ćwiczenia
- Wytrenuj model regresji logistycznej na danych treningowych i zapisz go jako
clf_logistic. - Użyj
predict_proba()na danych testowych, aby utworzyć prognozy, i zapisz je w zmiennejpreds. - Utwórz dwie ramki danych –
preds_dfitrue_df– przechowujące odpowiednio pierwsze pięć prognoz oraz rzeczywiste wartościloan_status. - Wyświetl
true_dfipreds_dfrazem, korzystając z.concat().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))