Validation croisée pour R-squared
La validation croisée est essentielle pour évaluer un modèle. Elle maximise la quantité de données accessibles au modèle, puisque celui-ci est non seulement entraîné, mais aussi testé sur l'ensemble des données disponibles.
Dans cet exercice, vous allez créer un modèle de régression linéaire, puis utiliser une validation croisée à 6 volets pour évaluer sa justesse à prédire les ventes à partir des dépenses publicitaires sur les médias sociaux. Vous afficherez le score individuel pour chacun des six volets.
Le jeu de données sales_df a été séparé en y pour la variable cible et X pour les variables explicatives, et il est déjà chargé pour vous. LinearRegression a été importé depuis sklearn.linear_model.
Cette activité fait partie du cours
Apprentissage supervisé avec scikit-learn
Instructions de l’exercice
- Importez
KFoldetcross_val_score. - Créez
kfen appelantKFold(), en fixant le nombre de partitions à six,shuffleàTrue, et une graine aléatoire de5. - Effectuez la validation croisée en utilisant
regsurXety, en passantkfàcv. - Affichez
cv_scores.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the necessary modules
from ____.____ import ____, ____
# Create a KFold object
kf = ____(n_splits=____, shuffle=____, random_state=____)
reg = LinearRegression()
# Compute 6-fold cross-validation scores
cv_scores = ____(____, ____, ____, cv=____)
# Print scores
print(____)