对信贷数据进行独热编码
现在需要准备非数值列,以便将它们加入到您的 LogisticRegression() 模型中。
使用独热编码创建新列后,您可以将它们与数值列拼接,生成一个新的数据框。该数据框将在课程的其余部分用于预测违约概率。
请记住,只对非数值列进行独热编码。若对数值列这样做,会让数据集变得异常宽!
工作区中已加载信贷贷款数据 cr_loan_clean。
本练习是课程的一部分
Python 信用风险建模
练习说明
- 为所有数值列创建一个名为
cred_num的数据集,并为所有非数值列创建一个名为cred_str的数据集。 - 对
cred_str应用独热编码,创建一个名为cred_str_onehot的新数据集。 - 将
cred_num与新的独热编码数据进行并集,结果保存为cr_loan_prep。 - 打印新数据集的列名。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)