Predikce pravděpodobnosti defaultu
Zpracování dat je hotové a přišel čas začít předpovídat pravděpodobnost defaultu. Natrénuješ model LogisticRegression() na připravených datech a podíváš se, jak odhaduje pravděpodobnost, že dlužník nesplatí úvěr.
Abys lépe pochopil/a, co model vrací pomocí predict_proba, porovnáš si ukázkový záznam s předpovězenou pravděpodobností defaultu. Jak si vedou prvních pět predikcí ve srovnání se skutečnými hodnotami loan_status?
Dataset cr_loan_prep spolu s proměnnými X_train, X_test, y_train a y_test jsou v pracovním prostředí již načteny.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Natrénuj model logistické regrese na trénovacích datech a ulož ho jako
clf_logistic. - Pomocí
predict_proba()vytvoř predikce na testovacích datech a ulož je do proměnnépreds. - Vytvoř dva datové rámce,
preds_dfatrue_df, pro uložení prvních pěti predikcí a skutečných hodnotloan_status. - Vypiš
true_dfapreds_dfspolečně pomocí.concat().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))