訓練模型
你終於可以訓練模型並選出表現最好的那個了!
不過,交叉驗證的計算量很大。在 DataCamp 上同時訓練所有模型會花太久時間。
如果在本機執行,你會使用以下程式碼:
# Fit cross validation models
models = cv.fit(training)
# Extract the best model
best_lr = models.bestModel
請記住,訓練資料名為 training,而你使用 lr 來訓練邏輯斯迴歸模型。交叉驗證已選出參數 regParam=0 與 elasticNetParam=0 作為最佳設定。這些是預設值,所以在訓練模型之前不需要再對 lr 做任何其他設定。
本練習屬於課程
PySpark 基礎
練習說明
- 呼叫
lr.fit(),以training資料作為輸入,建立best_lr。 - 列印
best_lr,確認它是LogisticRegressionModel類別的物件。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Call lr.fit()
best_lr = ____
# Print best_lr
print(____)