建立 pipeline
你終於可以建立一個 Pipeline 了!
Pipeline 是 pyspark.ml 模組中的一個類別,用來把你已經建立好的所有 Estimators 和 Transformers 串接在一起。這樣一來,你就能把整個建模流程包成一個簡單的物件,重複使用同一套流程。很方便吧?
本練習屬於課程
PySpark 基礎
練習說明
- 從
pyspark.ml匯入Pipeline。 - 使用關鍵字引數
stages呼叫Pipeline()建構子,建立名為flights_pipe的Pipeline。stages應該是個清單,包含你要在 pipeline 中讓資料通過的所有階段。這裡是:[dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import Pipeline
from ____ import ____
# Make the pipeline
flights_pipe = Pipeline(stages=____)