開始使用免費開始

對訓練集進行欠抽樣

在影片中,你看到為了克服類別不平衡的問題,可以使用欠抽樣或過度抽樣。我們已替你對訓練集進行欠抽樣,使得訓練集中 1/3 為違約樣本,2/3 為未違約樣本。處理後的資料集已放在你的工作環境中,名稱為 undersampled_training_set,而且觀測值較少(6570 筆,相較於原本的 19394 筆)。在本練習中,你將使用這個欠抽樣後的資料集來建立決策樹。

你會注意到本題與下一題產生的樹都非常大,大到幾乎看不清楚。先別擔心,我們會在下一支影片介紹如何把它們變得更容易閱讀!

本練習屬於課程

R 的信用風險建模

檢視課程

練習說明

  • 已為你安裝好 rpart 套件。請在工作環境中載入它。
  • 修改提供的程式碼,改為使用欠抽樣後的訓練集來建構決策樹,不要用 training_set。另外加入引數 control = rpart.control(cp = 0.001)cp(complexity parameter,複雜度參數)是任何分割導致整體擬合度不足下降的門檻值。若未達到 cp,將不再進行進一步分割。cp 的預設值是 0.01,但對於較複雜的問題,建議放寬 cp
  • 使用函式 plot 與樹物件名稱繪製決策樹。加入第二個引數 uniform = TRUE 以得到等長的分支。
  • 上一個指令只會畫出節點與邊,沒有任何文字(也就是所謂的「標籤」)。使用函式 text(),且唯一的引數為 tree_undersample,來加上標籤。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load package rpart in your workspace.


# Change the code provided in the video such that a decision tree is constructed using the undersampled training set. Include rpart.control to relax the complexity parameter to 0.001.
tree_undersample <- rpart(loan_status ~ ., method = "class",
                          data =  training_set)

# Plot the decision tree


# Add labels to the decision tree
編輯並執行程式碼