始める無料で始める

学習用データとテストデータの作成

あなたは先ほど、異なる列を使って LogisticRegression() モデルを学習しました。

データは学習用とテスト用に分割する必要があることを知っています。test_train_split() を使うと、両方を同時に作成できます。学習用データはモデルの学習に、テストデータは評価に使います。モデルを評価しなければ、新しいローンデータに対してどの程度うまく機能するのか判断できません。

モデルの属性である intercept_ に加えて、LogisticRegression() モデルには .coef_ 属性もあります。これは、延滞確率の予測において、各学習用の列がどれだけ重要かを示します。

データセット cr_loan_clean はすでにワークスペースに読み込まれています。

この演習はコースの一部です

Pythonで学ぶクレジットリスクモデリング

コースを見る

演習の手順

  • 金利、勤続年数、収入を使ってデータセット X を作成します。y はローンのステータスを使って作成します。
  • train_test_split() を使って、Xy から学習用とテスト用のセットを作成します。
  • LogisticRegression() モデルを作成して学習させ、clf_logistic として保存します。
  • .coef_ を使ってモデルの係数を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]

# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)

# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))

# Print the models coefficients
print(____.coef_)
コードを編集して実行