НачатьНачать бесплатно

Метод андерсэмплинга для обучающей выборки

Пришло время самостоятельно применить андерсэмплинг к обучающей выборке — для этого понадобится всего несколько строк кода из библиотеки Pandas. После завершения андерсэмплинга можно проверить подсчёт значений loan_status, чтобы убедиться в корректности результатов.

X_y_train, count_nondefault и count_default уже загружены в рабочее пространство. Они созданы с помощью следующего кода:

X_y_train = pd.concat([X_train.reset_index(drop = True),
                       y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()

Результат .value_counts() для исходной обучающей выборки будет выведен автоматически.

Это упражнение является частью курса

Моделирование кредитного риска на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте наборы данных для объектов без дефолта и с дефолтом и сохраните их как nondefaults и defaults.
  • Выполните выборку из nondefaults в количестве, равном count_default, и сохраните результат как nondefaults_under.
  • Объедините nondefaults и defaults с помощью .concat() и сохраните результат как X_y_train_under.
  • Выведите .value_counts() статуса кредита для нового набора данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]

# Undersample the non-defaults
____ = nondefaults.sample(____)

# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
                             ____.reset_index(drop = True)], axis = 0)

# Print the value counts for loan status
print(____[____].____())
Редактировать и запускать код