创建管道
终于可以创建一个 Pipeline 了!
Pipeline 是 pyspark.ml 模块中的一个类,用来把您已经创建的所有 Estimator 和 Transformer 组合在一起。这样就能把整个建模流程封装成一个简单对象,方便重复使用同一套流程。是不是很实用?
本练习是课程的一部分
PySpark 基础
练习说明
- 从
pyspark.ml导入Pipeline。 - 使用关键字参数
stages调用Pipeline()构造函数,创建名为flights_pipe的Pipeline。stages应该是一个列表,包含您希望数据在管道中依次经过的所有阶段。这里就是:[dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import Pipeline
from ____ import ____
# Make the pipeline
flights_pipe = Pipeline(stages=____)