重新取樣技巧
在上一個練習中,你已看到類別不平衡如何影響混淆矩陣的結果。在本練習中,你將練習重新取樣技巧,探索不同的重新取樣方式對像 loan_data 這樣存在類別不平衡的資料集會產生哪些不同結果。使用 sklearn 的 resample() 函式,將多數類別的列數調整為與少數類別相同稱為 downsampling;而將少數類別的列數調整為與多數類別相同則稱為 upsampling。
你會建立 loan_data 資料集的 upsampled 與 downsampled 版本,對兩者都套用羅吉斯回歸,然後評估效能。訓練資料及其對應的標籤中,deny 為少數類別的子集,approve 為多數類別的子集。
已在工作空間中為你儲存可用來做預測的訓練/測試切分物件 X_test,可於本練習中使用。
本練習屬於課程
用 Python 練習機器學習面試題
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])
# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False, n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])