De zéro à héros
Vous maîtrisez maintenant la création d'une spécification de modèle et la séparation des données en ensembles d'entraînement et de test. Vous savez aussi comment éviter les déséquilibres de classes lors de la séparation. Il est temps de réunir ce que vous avez appris à la leçon précédente et de construire votre modèle uniquement avec l'ensemble d'entraînement !
Vous allez mettre en place un véritable « machine learning pipeline ». Cela comprend la création d'une spécification de modèle, la division de vos données en ensembles d'entraînement et de test et, finalement, l'ajustement du modèle sur les données d'entraînement. Amusez-vous bien !
Cette activité fait partie du cours
Machine Learning avec des modèles arborescents en R
Instructions de l’exercice
- Créez
diabetes_split, une séparation où l'ensemble d'entraînement contient les trois quarts des lignes dediabeteset où les ensembles d'entraînement et de test ont une distribution similaire pour la variableoutcome. - Établissez une spécification d'arbre de décision pour votre modèle avec le moteur
rpartet enregistrez-la danstree_spec. - Ajustez un modèle
model_trainedà l'aide des données d'entraînement dediabetes_split, avecoutcomecomme variable cible etbmietskin_thicknesscomme prédicteurs.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
set.seed(9)
# Create the balanced data split
diabetes_split <- ___
# Build the specification of the model
tree_spec <- ___ %>%
___ %>%
___
# Train the model
model_trained <- ___ %>%
fit(___,
___)
model_trained