航班时长模型:Pipeline 阶段
您将为航班时长模型的 Pipeline 创建各个阶段。下一道练习中,您会用这些阶段来构建 Pipeline,并训练一个回归模型。
StringIndexer、OneHotEncoder、VectorAssembler 和 LinearRegression 类已完成导入。
本练习是课程的一部分
使用 PySpark 进行机器学习
练习说明
- 创建一个 indexer,将 'org' 列转换为名为 'org_idx' 的索引列。
- 创建一个独热编码器,将 'org_idx' 和 'dow' 列转换为名为 'org_dummy' 和 'dow_dummy' 的哑变量列。
- 创建一个 assembler,将 'km' 列与上述两个哑变量列合并。输出列名称应为 'features'。
- 创建一个线性回归对象,用于预测航班时长。
您可以回看本课的幻灯片来复习要点:在 IPython Shell 旁边的 Slides 面板中可以找到。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Convert categorical strings to index values
indexer = ____(____)
# One-hot encode index values
onehot = ____(
inputCols=____,
outputCols=____
)
# Assemble predictors into a single column
assembler = ____(inputCols=____, outputCol=____)
# A linear regression object
regression = ____(labelCol=____)