建立訓練集與測試集
你剛剛在不同欄位上訓練了 LogisticRegression() 模型。
你知道資料應該分成訓練集與測試集。test_train_split() 可同時建立這兩者。訓練集用來建立預測;測試集用來評估表現。若沒有評估模型,你就無法判斷它在新的貸款資料上表現得如何。
除了做為模型屬性的 intercept_ 之外,LogisticRegression() 模型也有 .coef_ 屬性。它會顯示每個訓練欄位對於預測違約機率的重要程度。
資料集 cr_loan_clean 已經載入到工作空間。
本練習屬於課程
以 Python 進行信用風險建模
練習說明
- 建立資料集
X,使用利率、工作年資與收入三個欄位。使用貸款狀態建立y。 - 使用
train_test_split()由X和y建立訓練集與測試集。 - 建立並訓練一個
LogisticRegression()模型,存成clf_logistic。 - 使用
.coef_列印模型係數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]
# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)
# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the models coefficients
print(____.coef_)