建立 Logistic Regression 模型
你已經用航班資料建立過一個 Decision Tree 模型。現在要在同一份資料上建立一個 Logistic Regression 模型。
目標是預測某航班是否有可能延誤至少 15 分鐘(標籤為 1),或不延誤(標籤為 0)。
雖然你手邊有多種預測變數可用,這裡先只使用 mon、depart 和 duration 欄位。這些是數值型特徵,可以直接用於 Logistic Regression 模型。若要納入類別型特徵,還需要再做一些前處理,稍後會帶你完成!
資料已分割為訓練集與測試集,分別為 flights_train 與 flights_test。
本練習屬於課程
使用 PySpark 的機器學習
練習說明
- 匯入用來建立 Logistic Regression 分類器的類別。
- 建立分類器物件,並用訓練資料進行訓練。
- 對測試資料進行預測,並建立混淆矩陣。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the logistic regression class
from pyspark.ml.____ import ____
# Create a classifier object and train on training data
logistic = ____().____(____)
# Create predictions for the testing data and show confusion matrix
prediction = ____.____(____)
prediction.groupBy(____, ____).____().show()