CommencezCommencez gratuitement

De zéro à héros

Vous maîtrisez maintenant la création d'une spécification de modèle et la séparation des données en ensembles d'entraînement et de test. Vous savez aussi comment éviter les déséquilibres de classes lors de la séparation. Il est temps de réunir ce que vous avez appris à la leçon précédente et de construire votre modèle uniquement avec l'ensemble d'entraînement !

Vous allez mettre en place un véritable « machine learning pipeline ». Cela comprend la création d'une spécification de modèle, la division de vos données en ensembles d'entraînement et de test et, finalement, l'ajustement du modèle sur les données d'entraînement. Amusez-vous bien !

Cette activité fait partie du cours

Machine Learning avec des modèles arborescents en R

Voir le cours

Instructions de l’exercice

  • Créez diabetes_split, une séparation où l'ensemble d'entraînement contient les trois quarts des lignes de diabetes et où les ensembles d'entraînement et de test ont une distribution similaire pour la variable outcome.
  • Établissez une spécification d'arbre de décision pour votre modèle avec le moteur rpart et enregistrez-la dans tree_spec.
  • Ajustez un modèle model_trained à l'aide des données d'entraînement de diabetes_split, avec outcome comme variable cible et bmi et skin_thickness comme prédicteurs.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

set.seed(9)

# Create the balanced data split
diabetes_split <- ___

# Build the specification of the model
tree_spec <- ___ %>% 
  ___ %>% 
  ___

# Train the model
model_trained <- ___ %>% 
  fit(___, 
      ___)

model_trained
Modifier et exécuter le code