Метод андерсэмплинга для обучающей выборки
Пришло время самостоятельно применить андерсэмплинг к обучающей выборке — для этого понадобится всего несколько строк кода из библиотеки Pandas. После завершения андерсэмплинга можно проверить подсчёт значений loan_status, чтобы убедиться в корректности результатов.
X_y_train, count_nondefault и count_default уже загружены в рабочее пространство. Они созданы с помощью следующего кода:
X_y_train = pd.concat([X_train.reset_index(drop = True),
y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()
Результат .value_counts() для исходной обучающей выборки будет выведен автоматически.
Это упражнение является частью курса
Моделирование кредитного риска на Python
Инструкции к упражнению
- Создайте наборы данных для объектов без дефолта и с дефолтом и сохраните их как
nondefaultsиdefaults. - Выполните выборку из
nondefaultsв количестве, равномcount_default, и сохраните результат какnondefaults_under. - Объедините
nondefaultsиdefaultsс помощью.concat()и сохраните результат какX_y_train_under. - Выведите
.value_counts()статуса кредита для нового набора данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]
# Undersample the non-defaults
____ = nondefaults.sample(____)
# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
____.reset_index(drop = True)], axis = 0)
# Print the value counts for loan status
print(____[____].____())