独热编码与哑变量
要在机器学习模型中使用分类变量,首先需要将其转换为数值表示。最常见的两种方法是使用独热编码,或使用哑变量。在本练习中,您将创建这两种编码,并比较生成的列集合。我们将继续使用上一课加载的同一个 DataFrame so_survey_df,并聚焦其 Country 列。
本练习是课程的一部分
Python 中的机器学习特征工程
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Convert the Country column to a one hot encoded Data Frame
one_hot_encoded = ____(____, ____=['Country'], prefix='OH')
# Print the columns names
print(one_hot_encoded.columns)