开始使用免费开始使用

航班时长模型:Pipeline 模型

现在,您已经可以把这些阶段组合成一个流水线了。

您将先构建流水线,然后在训练数据上训练它。这样会依次将流水线中的每个阶段应用到训练数据上。任何阶段都不会接触测试数据:不会发生泄漏!

当整个流水线训练完成后,将用它在测试数据上进行预测。

数据以 flights 提供,已随机划分为 flights_trainflights_test

本练习是课程的一部分

使用 PySpark 进行机器学习

查看课程

练习说明

  • 导入用于创建流水线的类。
  • 创建一个流水线对象,并按此顺序指定 indexeronehotassemblerregression 各阶段。
  • 在训练数据上训练该流水线。
  • 在测试数据上进行预测。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import class for creating a pipeline
from pyspark.____ import ____

# Construct a pipeline
pipeline = ____(____=[____])

# Train the pipeline on the training data
pipeline = pipeline.____(____)

# Make predictions on the testing data
predictions = ____.____(____)
编辑并运行代码