開始使用免費開始

重新取樣技巧

在上一個練習中,你已看到類別不平衡如何影響混淆矩陣的結果。在本練習中,你將練習重新取樣技巧,探索不同的重新取樣方式對像 loan_data 這樣存在類別不平衡的資料集會產生哪些不同結果。使用 sklearnresample() 函式,將多數類別的列數調整為與少數類別相同稱為 downsampling;而將少數類別的列數調整為與多數類別相同則稱為 upsampling。

你會建立 loan_data 資料集的 upsampled 與 downsampled 版本,對兩者都套用羅吉斯回歸,然後評估效能。訓練資料及其對應的標籤中,deny 為少數類別的子集,approve 為多數類別的子集。

已在工作空間中為你儲存可用來做預測的訓練/測試切分物件 X_test,可於本練習中使用。

本練習屬於課程

用 Python 練習機器學習面試題

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])

# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False,  n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])
編輯並執行程式碼