開始使用免費開始

探索信用資料

在本課程的練習中,我們會持續使用影片中提到的資料集 loan_data

拿到 loan_data 之後,你特別想了解資料中的違約貸款。你想先掌握違約的件數與百分比。由於違約相對少見,你在處理任何貸款資料集時都應先檢查違約的比例。這時 CrossTable() 函式非常實用。

請記住,違約資訊儲存在應變數 loan_status 中,其中 1 代表「default」,0 代表「non-default」。

若要更深入了解變數結構並發現資料中可能的異常趨勢,你應該檢視 loan_status 與某些 factor 變數之間的關係。舉例來說,你會預期 grade 為 G(最差信用評等)的客群,其違約比例會明顯高於 grade 為 A(最佳信用評等)的客群。

更方便的是,CrossTable() 也能用在兩個類別變數上。我們就來探索看看!

本練習屬於課程

R 的信用風險建模

檢視課程

練習說明

  • 使用 str() 檢視資料結構,先熟悉這個資料集。
  • 使用 library() 載入 gmodels 套件。此套件已安裝在 DataCamp 的伺服器上。
  • 先只用一個引數 loan_data$loan_status,查看貸款狀態的 CrossTable()
  • x 引數為 loan_data$gradey 引數為 loan_data$loan_status 呼叫 CrossTable()。我們只需要列方向比例,因此將 prop.r 設為 TRUE,而將 prop.cprop.tprop.chisq 設為 FALSE(這些的預設值為 TRUE,會包含欄比例、整體表比例與每格的卡方貢獻。我們在此不需要)。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# View the structure of loan_data


# Load the gmodels package 


# Call CrossTable() on loan_status


# Call CrossTable() on grade and loan_status

編輯並執行程式碼