НачатьНачать бесплатно

Унитарное кодирование кредитных данных

Пришло время подготовить нечисловые столбцы, чтобы добавить их в модель LogisticRegression().

После создания новых столбцов с помощью унитарного кодирования вы сможете объединить их с числовыми столбцами и сформировать новый датафрейм, который будет использоваться на протяжении всего курса для прогнозирования вероятности дефолта.

Не забывайте применять унитарное кодирование только к нечисловым столбцам — применение его к числовым значительно увеличит размерность набора данных!

Данные по кредитам cr_loan_clean уже загружены в рабочую среду.

Это упражнение является частью курса

Моделирование кредитного риска на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте набор данных из всех числовых столбцов и назовите его cred_num, а из нечисловых — cred_str.
  • Примените унитарное кодирование к cred_str, чтобы получить новый набор данных cred_str_onehot.
  • Объедините cred_num с новыми унитарно закодированными данными и сохраните результат как cr_loan_prep.
  • Выведите столбцы нового набора данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])

# One-hot encode the non-numeric columns
____ = pd.____(____)

# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)

# Print the columns in the new data set
print(____.columns)
Редактировать и запускать код