Ajuster le ou les modèles
Vous êtes enfin prêt à ajuster les modèles et à sélectionner le meilleur.
Malheureusement, la validation croisée est une procédure qui nécessite une puissance de calcul considérable. L'ajustement de tous les modèles prendrait trop de temps sur DataCamp.
Pour effectuer cette opération localement, veuillez utiliser le code suivant :
# Fit cross validation models
models = cv.fit(training)
# Extract the best model
best_lr = models.bestModel
Veuillez noter que les données d'entraînement sont appelées training et que vous utilisez lr pour ajuster un modèle de régression logistique. La validation croisée a sélectionné les valeurs de paramètres regParam=0 et elasticNetParam=0 comme étant les meilleures. Il s'agit des valeurs par défaut, vous n'avez donc pas besoin d'effectuer d'autres opérations avec lr avant d'ajuster le modèle.
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Instructions de l’exercice
- Veuillez créer
best_lren appelantlr.fit()sur les donnéestraining. - Affichez
best_lrpour vérifier qu'il s'agit bien d'un objet de la classeLogisticRegressionModel.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Call lr.fit()
best_lr = ____
# Print best_lr
print(____)