開始使用免費開始

用 Pipeline 預測歌曲熱門度

在最後一題中,你將建構一個 pipeline,用來填補遺漏值、縮放特徵,並對邏輯斯回歸模型進行超參數調校。目標是找出在預測歌曲曲風時的最佳參數與最佳準確率!

建立 pipeline 所需的所有模型與物件都已為你預先載入。

本練習屬於課程

使用 scikit-learn 進行監督式學習

檢視課程

練習說明

  • 依序建立 pipeline 的步驟:呼叫簡單插補器、標準化縮放器,以及邏輯斯回歸模型。
  • 建立一個 pipeline 物件,並傳入變數 steps
  • 建立一個網格搜尋物件,使用該 pipeline 與參數進行交叉驗證。
  • 列印最佳參數,並計算與列印該網格搜尋物件在測試集上的準確率分數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create steps
steps = [("imp_mean", ____()), 
         ("scaler", ____()), 
         ("logreg", ____())]

# Set up pipeline
pipeline = ____(____)
params = {"logreg__solver": ["newton-cg", "saga", "lbfgs"],
         "logreg__C": np.linspace(0.001, 1.0, 10)}

# Create the GridSearchCV object
tuning = ____(____, param_grid=____)
tuning.fit(X_train, y_train)
y_pred = tuning.predict(X_test)

# Compute and print performance
print("Tuned Logistic Regression Parameters: {}, Accuracy: {}".format(____.____, ____.____))
編輯並執行程式碼