Validation croisée KFold
Lorsque vous travaillez avec des modèles de Machine Learning, il est essentiel d'évaluer leur performance sur des données jamais vues, tout en s'assurant de la robustesse de l'évaluation. Une technique courante pour cela est la validation croisée en k volets (k-fold). Dans cet exercice, vous allez voir comment la validation croisée en k volets divise un jeu de données en ensembles d'entraînement et de test. KFold est déjà importé pour vous, de même que les caractéristiques du jeu de données sur les maladies cardiaques heart_disease_df_X.
Cette activité fait partie du cours
Apprentissage Machine de bout en bout
Instructions de l’exercice
- Créez un objet KFold avec
n_splits=5,shuffle=Trueetrandom_state=42 - Divisez les données avec
kfold.split() - Affichez le nombre de points de données dans les sous-ensembles d'entraînement et de test
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a KFold object
kfold = ____(____, ____, ____)
# Get the train and test data from the first split from the shuffled KFold
train_data_split, test_data_split = next(____.____(____))
# Print out the number of datapoints in the train and test splits
print("Number of training datapoints in heart_disease_df_X:", ____)
print("Number of training datapoints in split:", ____)
print("Number of testing datapoints in split:", ____)