Validation croisée
Dans les exercices suivants, vous allez ajuster votre modèle de régression logistique à l'aide d'une procédure appelée validation croisée k-fold. Il s'agit d'une méthode permettant d'estimer les performances du modèle sur des données non observées (telles que votre DataFrame test).
Elle fonctionne en divisant les données d'entraînement en plusieurs partitions distinctes. Le nombre exact dépend de votre choix, mais dans ce cours, vous utiliserez la valeur par défaut de PySpark, qui est trois. Une fois les données divisées, l'une des partitions est mise de côté et le modèle est ajusté aux autres. Ensuite, l'erreur est évaluée par rapport à la partition conservée. Cette opération est répétée pour chacune des partitions, de sorte que chaque bloc de données soit conservé et utilisé exactement une fois comme ensemble de test. Ensuite, l'erreur sur chacune des partitions est calculée en moyenne. Ceci est appelé l'erreur de validation croisée du modèle et constitue une bonne estimation de l'erreur réelle sur les données retenues.
Vous utiliserez la validation croisée pour sélectionner les hyperparamètres en créant une grille des paires de valeurs possibles pour les deux hyperparamètres, elasticNetParam et regParam, et en utilisant l'erreur de validation croisée pour comparer tous les différents modèles afin de pouvoir choisir le meilleur.
Que permet d'estimer la validation croisée ?
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Exercice interactif pratique
Transformez la théorie en action avec l’un de nos exercices interactifs
Commencer l’exercice