延滞確率の予測
すべてのデータ前処理が完了し、いよいよ延滞確率の予測を作成します。LogisticRegression() モデルを学習させて、延滞確率の予測がどのように得られるかを確認しましょう。
predict_proba が出力する内容を具体的に理解するために、予測された延滞確率とサンプルのレコードを並べて見てみます。最初の5件の予測は、実際の loan_status と比べてどう見えるでしょうか?
データセット cr_loan_prep に加え、X_train、X_test、y_train、y_test はすでにワークスペースに読み込まれています。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
演習の手順
- 学習データでロジスティック回帰モデルを学習し、
clf_logisticとして保存してください。 - テストデータに対して
predict_proba()を用いて予測を作成し、predsに保存してください。 - 先頭5件の予測値と実際の
loan_statusを保持するデータフレームpreds_dfとtrue_dfを作成してください。 .concat()を使って、true_dfとpreds_dfを1つにまとめて表示してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))