クロスバリデーション用のパイプラインを構築する
データ、訓練/テスト分割、モデル、ハイパーパラメータの候補がそろいました。ここでは、Spark にクロスバリデーションの方法を指示して、最適なハイパーパラメータの組み合わせを見つけて返してもらいましょう。
この演習はコースの一部です
PySpark で作る Recommendation Engines
演習の手順
- 推定器に
alsモデルを用い、estimatorParamMapsに作成したparam_gridを設定して、cvというCrossValidatorを作成します。使用するevaluatorは、先ほど作成した"evaluator"であることを Spark に伝えます。numFoldsは 5 に設定します。 cvを出力して、正しく作成できたことを確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Build cross validation using CrossValidator
____ = CrossValidator(estimator=____, estimatorParamMaps=____, evaluator=____, numFolds=____)
# Confirm cv was built
print(____)