Техніки ресемплінгу
У попередній вправі ви побачили, як дисбаланс класів може впливати на результати вашої матриці неточностей. У цій вправі ви попрактикуєте техніки ресемплінгу, щоб дослідити, як різні підходи можуть змінювати результати на наборі даних із дисбалансом класів, як у loan_data. Використовуючи функцію resample() з sklearn, узгодження кількості рядків із більшістю називається апсемплінгом, а узгодження кількості рядків із меншістю — даунсемплінгом.
Ви створите як апсемплінгову, так і даунсемплінгову версії набору loan_data, застосуєте логістичну регресію до кожної з них, а потім оціните якість. Тренувальні дані та їхні мітки, що відповідають deny, виділені лише для класу меншості, а approve — для класу більшості.
Об'єкт тестової вибірки для передбачень уже збережено в робочому середовищі як X_test для використання у вправах.
Ця вправа є частиною курсу
Практика співбесід з Machine Learning у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])
# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False, n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])