交叉驗證信用風險模型
信用貸款及其資料會隨時間改變,而且不一定會長得像目前載入的測試集。所以,你可以用交叉驗證,從原始的 X_train 和 y_train 派生出多組較小的訓練集與測試集來嘗試。
使用 XGBoost 的 cv() 函式來執行交叉驗證。你需要設定 cv() 在測試資料上要用到的所有參數。
工作空間已載入資料集 X_train、y_train、已訓練的模型 gbt,以及參數字典 params(練習開始時會列印)。
本練習屬於課程
以 Python 進行信用風險建模
練習說明
- 將摺數設為
5、提早停止設為10,分別存成n_folds和early_stopping。 - 使用訓練資料建立矩陣物件
DTrain。 - 在參數、摺數與提早停止物件上呼叫
cv()。將結果存為cv_df。 - 列印
cv_df的內容。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Set the values for number of folds and stopping iterations
____ = ____
____ = ____
# Create the DTrain matrix for XGBoost
____ = xgb.____(____, label = ____)
# Create the data frame of cross validations
____ = xgb.cv(____, ____, num_boost_round = 5, nfold=____,
early_stopping_rounds=____)
# Print the cross validations data frame
____(____)