用 Pipeline 預測歌曲熱門度
在最後一題中,你將建構一個 pipeline,用來填補遺漏值、縮放特徵,並對邏輯斯回歸模型進行超參數調校。目標是找出在預測歌曲曲風時的最佳參數與最佳準確率!
建立 pipeline 所需的所有模型與物件都已為你預先載入。
本練習屬於課程
使用 scikit-learn 進行監督式學習
練習說明
- 依序建立 pipeline 的步驟:呼叫簡單插補器、標準化縮放器,以及邏輯斯回歸模型。
- 建立一個 pipeline 物件,並傳入變數
steps。 - 建立一個網格搜尋物件,使用該 pipeline 與參數進行交叉驗證。
- 列印最佳參數,並計算與列印該網格搜尋物件在測試集上的準確率分數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create steps
steps = [("imp_mean", ____()),
("scaler", ____()),
("logreg", ____())]
# Set up pipeline
pipeline = ____(____)
params = {"logreg__solver": ["newton-cg", "saga", "lbfgs"],
"logreg__C": np.linspace(0.001, 1.0, 10)}
# Create the GridSearchCV object
tuning = ____(____, param_grid=____)
tuning.fit(X_train, y_train)
y_pred = tuning.predict(X_test)
# Compute and print performance
print("Tuned Logistic Regression Parameters: {}, Accuracy: {}".format(____.____, ____.____))