学習用データとテストデータの作成
あなたは先ほど、異なる列を使って LogisticRegression() モデルを学習しました。
データは学習用とテスト用に分割する必要があることを知っています。test_train_split() を使うと、両方を同時に作成できます。学習用データはモデルの学習に、テストデータは評価に使います。モデルを評価しなければ、新しいローンデータに対してどの程度うまく機能するのか判断できません。
モデルの属性である intercept_ に加えて、LogisticRegression() モデルには .coef_ 属性もあります。これは、延滞確率の予測において、各学習用の列がどれだけ重要かを示します。
データセット cr_loan_clean はすでにワークスペースに読み込まれています。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
演習の手順
- 金利、勤続年数、収入を使ってデータセット
Xを作成します。yはローンのステータスを使って作成します。 train_test_split()を使って、Xとyから学習用とテスト用のセットを作成します。LogisticRegression()モデルを作成して学習させ、clf_logisticとして保存します。.coef_を使ってモデルの係数を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]
# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)
# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the models coefficients
print(____.coef_)