Validation croisée
Dans les prochains exercices, vous allez régler votre modèle de régression logistique au moyen d'une procédure appelée validation croisée en k volets. Cette méthode permet d'estimer la performance du modèle sur des données jamais vues (comme votre DataFrame test).
Elle consiste à diviser les données d'entraînement en quelques partitions. Le nombre exact vous revient, mais dans ce cours vous utiliserez la valeur par défaut de PySpark, soit trois. Une fois les données divisées, on met de côté l'une des partitions et on ajuste le modèle sur les autres. Ensuite, on mesure l'erreur par rapport à la partition mise de côté. On répète l'opération pour chacune des partitions, afin que chaque bloc de données soit exclu et utilisé comme ensemble de test une seule fois. Puis, on fait la moyenne des erreurs obtenues pour chaque partition. C'est ce qu'on appelle l'erreur de validation croisée du modèle, et cela constitue une bonne estimation de l'erreur réelle sur les données mises de côté.
Vous utiliserez la validation croisée pour choisir les hyperparamètres en créant une grille de toutes les paires possibles de valeurs pour les deux hyperparamètres, elasticNetParam et regParam, puis en vous appuyant sur l'erreur de validation croisée pour comparer tous les modèles et sélectionner le meilleur !
Qu'est-ce que la validation croisée vous permet d'estimer ?
Cette activité fait partie du cours
Fondements de PySpark
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice