探索信用資料
在本課程的練習中,我們會持續使用影片中提到的資料集 loan_data。
拿到 loan_data 之後,你特別想了解資料中的違約貸款。你想先掌握違約的件數與百分比。由於違約相對少見,你在處理任何貸款資料集時都應先檢查違約的比例。這時 CrossTable() 函式非常實用。
請記住,違約資訊儲存在應變數 loan_status 中,其中 1 代表「default」,0 代表「non-default」。
若要更深入了解變數結構並發現資料中可能的異常趨勢,你應該檢視 loan_status 與某些 factor 變數之間的關係。舉例來說,你會預期 grade 為 G(最差信用評等)的客群,其違約比例會明顯高於 grade 為 A(最佳信用評等)的客群。
更方便的是,CrossTable() 也能用在兩個類別變數上。我們就來探索看看!
本練習屬於課程
R 的信用風險建模
練習說明
- 使用
str()檢視資料結構,先熟悉這個資料集。 - 使用
library()載入 gmodels 套件。此套件已安裝在 DataCamp 的伺服器上。 - 先只用一個引數
loan_data$loan_status,查看貸款狀態的CrossTable()。 - 以
x引數為loan_data$grade、y引數為loan_data$loan_status呼叫CrossTable()。我們只需要列方向比例,因此將prop.r設為TRUE,而將prop.c、prop.t與prop.chisq設為FALSE(這些的預設值為TRUE,會包含欄比例、整體表比例與每格的卡方貢獻。我們在此不需要)。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# View the structure of loan_data
# Load the gmodels package
# Call CrossTable() on loan_status
# Call CrossTable() on grade and loan_status