Test par rapport à l’entraînement
Une fois que vous avez nettoyé vos données et les avez préparées pour la modélisation, l'une des étapes les plus importantes consiste à diviser les données en un ensemble de test et un ensemble d'entraînement. Par la suite, veuillez ne pas modifier vos données de test jusqu'à ce que vous soyez convaincu d'avoir un modèle satisfaisant. Lorsque vous créez des modèles et formulez des hypothèses, vous pouvez les tester sur vos données d'entraînement afin d'évaluer leurs performances.
Une fois que vous avez sélectionné votre modèle préféré, vous pouvez évaluer sa capacité à prédire les nouvelles données de votre ensemble de test. Ces données inédites vous permettront d'avoir une idée beaucoup plus réaliste des performances de votre modèle dans le monde réel lorsque vous essayez de prédire ou de classer de nouvelles données.
Dans Spark, il est essentiel de veiller à diviser les données après toutes les transformations. En effet, des opérations telles que StringIndexer ne produisent pas toujours le même index, même lorsque la liste de chaînes est identique.
Pourquoi est-il important d'utiliser un ensemble de test dans l'évaluation d'un modèle ?
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Exercice interactif pratique
Transformez la théorie en action avec l’un de nos exercices interactifs
Commencer l’exercice