モデルを学習する
ついにモデルを学習し、最良のモデルを選ぶ準備が整いました!
ただし、クロスバリデーションは計算コストがとても高い手法です。すべてのモデルを学習させると、DataCamp 上では時間がかかりすぎてしまいます。
ローカル環境で行う場合は、次のコードを使います。
# クロスバリデーションでモデルを学習
models = cv.fit(training)
# 最良モデルを取り出す
best_lr = models.bestModel
学習用データは training、ロジスティック回帰モデルの学習には lr を使っていることを思い出してください。クロスバリデーションにより、最良のパラメータは regParam=0 と elasticNetParam=0 と選ばれました。これは既定値なので、学習前に lr に対して追加の設定を行う必要はありません。
この演習はコースの一部です
PySpark入門
演習の手順
trainingデータに対してlr.fit()を呼び出し、best_lrを作成します。best_lrを表示して、LogisticRegressionModelクラスのオブジェクトであることを確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Call lr.fit()
best_lr = ____
# Print best_lr
print(____)