楽曲の人気度予測パイプライン
最後の演習では、欠損値の補完、特徴量のスケーリング、およびロジスティック回帰モデルのハイパーパラメータチューニングを行うパイプラインを構築します。目標は、曲のジャンルを予測する際に最適なパラメータと精度を見つけることです。
パイプラインの構築に必要なモデルとオブジェクトはあらかじめ読み込まれています。
この演習はコースの一部です
scikit-learn による教師あり学習
演習の手順
- シンプルな補完器、標準スケーラー、ロジスティック回帰モデルを呼び出して、パイプラインのステップを作成します。
- パイプラインオブジェクトを作成し、
steps変数を渡します。 - パイプラインとパラメータを使用して交差検証を行うグリッドサーチオブジェクトをインスタンス化します。
- 最適なパラメータを出力し、グリッドサーチオブジェクトのテストセット精度スコアを計算して出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create steps
steps = [("imp_mean", ____()),
("scaler", ____()),
("logreg", ____())]
# Set up pipeline
pipeline = ____(____)
params = {"logreg__solver": ["newton-cg", "saga", "lbfgs"],
"logreg__C": np.linspace(0.001, 1.0, 10)}
# Create the GridSearchCV object
tuning = ____(____, param_grid=____)
tuning.fit(X_train, y_train)
y_pred = tuning.predict(X_test)
# Compute and print performance
print("Tuned Logistic Regression Parameters: {}, Accuracy: {}".format(____.____, ____.____))