开始使用免费开始使用

对信贷数据进行独热编码

现在需要准备非数值列,以便将它们加入到您的 LogisticRegression() 模型中。

使用独热编码创建新列后,您可以将它们与数值列拼接,生成一个新的数据框。该数据框将在课程的其余部分用于预测违约概率。

请记住,只对非数值列进行独热编码。若对数值列这样做,会让数据集变得异常宽!

工作区中已加载信贷贷款数据 cr_loan_clean

本练习是课程的一部分

Python 信用风险建模

查看课程

练习说明

  • 为所有数值列创建一个名为 cred_num 的数据集,并为所有非数值列创建一个名为 cred_str 的数据集。
  • cred_str 应用独热编码,创建一个名为 cred_str_onehot 的新数据集。
  • cred_num 与新的独热编码数据进行并集,结果保存为 cr_loan_prep
  • 打印新数据集的列名。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])

# One-hot encode the non-numeric columns
____ = pd.____(____)

# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)

# Print the columns in the new data set
print(____.columns)
编辑并运行代码