開始使用免費開始

組裝欄位

資料前處理的最後一步,是把所有預測變數欄位整併為單一欄位。

更新後的 flights 資料(已納入前幾個練習中的所有變更)包含以下預測變數欄位:

  • mondomdow
  • carrier_idx(由 carrier 編碼而得的索引值)
  • org_idx(由 org 編碼而得的索引值)
  • km
  • depart
  • duration

注意: show() 方法中的引數 truncate=False 可避免在輸出時截斷資料。

本練習屬於課程

使用 PySpark 的機器學習

檢視課程

練習說明

  • 匯入用來組裝預測變數的類別。
  • 建立一個 assembler 物件,讓你把多個預測變數欄位合併成單一欄位。
  • 使用該 assembler 產生新的整併欄位。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
編輯並執行程式碼