Test vs Train
Une fois que vous avez nettoyé vos données et que vous les avez préparées pour la modélisation, l'une des étapes les plus importantes consiste à diviser les données en un ensemble de test et un ensemble d'entraînement. Après cela, ne touchez plus à vos données de test tant que vous n'estimez pas avoir un bon modèle ! Pendant que vous bâtissez des modèles et formulez des hypothèses, vous pouvez les vérifier sur vos données d'entraînement pour avoir une idée de leur performance.
Quand vous avez votre modèle favori, vous pouvez évaluer la qualité de ses prédictions sur les nouvelles données de votre ensemble de test. Ces données jamais vues auparavant vous donneront une idée beaucoup plus réaliste des performances de votre modèle dans le monde réel lorsque vous tenterez de prédire ou de classer de nouvelles données.
Dans Spark, il est important de s'assurer de scinder les données après toutes les transformations. En effet, des opérations comme StringIndexer ne produisent pas toujours le même index, même avec la même liste de chaînes.
Pourquoi est-il important d'utiliser un ensemble de test pour évaluer un modèle ?
Cette activité fait partie du cours
Fondements de PySpark
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice