Унитарное кодирование кредитных данных
Пришло время подготовить нечисловые столбцы, чтобы добавить их в модель LogisticRegression().
После создания новых столбцов с помощью унитарного кодирования вы сможете объединить их с числовыми столбцами и сформировать новый датафрейм, который будет использоваться на протяжении всего курса для прогнозирования вероятности дефолта.
Не забывайте применять унитарное кодирование только к нечисловым столбцам — применение его к числовым значительно увеличит размерность набора данных!
Данные по кредитам cr_loan_clean уже загружены в рабочую среду.
Это упражнение является частью курса
Моделирование кредитного риска на Python
Инструкции к упражнению
- Создайте набор данных из всех числовых столбцов и назовите его
cred_num, а из нечисловых —cred_str. - Примените унитарное кодирование к
cred_str, чтобы получить новый набор данныхcred_str_onehot. - Объедините
cred_numс новыми унитарно закодированными данными и сохраните результат какcr_loan_prep. - Выведите столбцы нового набора данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)