对特定列进行 One-hot 编码
一家本地二手车经销商希望您帮助预测车辆的销售价格。如果对整个 used_cars 数据集进行 one-hot 编码,新的数据集会有超过 1,200 列。您担心这可能会给训练用于预测价格的机器学习模型带来问题。您决定尝试更简单的方法,只对少数几列进行 one-hot 编码。
本练习是课程的一部分
在 Python 中处理分类数据
练习说明
- 创建一个新的数据集
used_cars_simple,仅对以下列进行 one-hot 编码,并按此顺序:"manufacturer_name"和"transmission"。 - 将所有新列的前缀设置为
"dummy",以便您可以轻松筛选出新创建的列。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
used_cars,
# Specify the columns from the instructions
____,
# Set the prefix
____
)
# Print the shape of the new dataset
print(used_cars_simple.shape)