Répartition des valeurs de la variable cible
Effectuer une stratification selon la variable cible lors de la création des jeux d'entraînement et de test permet d'avoir des valeurs de la variable cible d'une portée similaire dans les deux jeux de données.
Comme la division initiale des données se fait au hasard, la stratification évite, par exemple, que toutes les maisons coûteuses de home_sales se retrouvent dans le jeu de test. Dans ce cas, votre modèle risquerait de moins bien performer, puisqu'il aurait été entraîné sur des maisons moins chères.
Dans cet exercice, vous calculerez des statistiques sommaires pour la variable selling_price dans les jeux d'entraînement et de test. Les tibbles home_training et home_test ont été chargés à partir de l'exercice précédent.
Cette activité fait partie du cours
Modélisation avec tidymodels en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Distribution of selling_price in training data
___ %>%
summarize(min_sell_price = ___,
max_sell_price = ___,
mean_sell_price = ___,
sd_sell_price = ___)