Séparation entraînement/test
Pour évaluer vos modèles, vous devez les créer et les tester sur deux parties différentes des données — autrement, c'est comme tricher à un examen (vous connaissez déjà les réponses).
La séparation des données fait partie intégrante du processus de modélisation. Vous allez vous y exercer en divisant les données sur le diabète et en confirmant les proportions de la séparation.
Les données diabetes de l'exercice précédent sont déjà chargées dans votre environnement de travail.
Cette activité fait partie du cours
Machine Learning avec des modèles arborescents en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create the split
diabetes_split <- ___(___, prop = ___)
# Print the data split
___