組裝欄位
資料前處理的最後一步,是把所有預測變數欄位整併為單一欄位。
更新後的 flights 資料(已納入前幾個練習中的所有變更)包含以下預測變數欄位:
mon、dom和dowcarrier_idx(由carrier編碼而得的索引值)org_idx(由org編碼而得的索引值)kmdepartduration
注意: show() 方法中的引數 truncate=False 可避免在輸出時截斷資料。
本練習屬於課程
使用 PySpark 的機器學習
練習說明
- 匯入用來組裝預測變數的類別。
- 建立一個 assembler 物件,讓你把多個預測變數欄位合併成單一欄位。
- 使用該 assembler 產生新的整併欄位。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)