CommencezCommencez gratuitement

Utiliser les indices KFold

Vous avez déjà créé splits, qui contient les indices du jeu de données candy-data pour effectuer une validation croisée à 5 volets (5-fold). Pour mieux estimer la performance du modèle Random Forest de votre collègue sur de nouvelles données, vous voulez l'exécuter sur les cinq paires d'indices d'entraînement et de validation que vous venez de créer.

Dans cet exercice, vous utiliserez ces indices pour vérifier la justesse de ce modèle sur les cinq divisions. Une boucle for est fournie pour vous aider dans ce processus.

Cette activité fait partie du cours

Validation de modèles en Python

Voir le cours

Instructions de l’exercice

  • Utilisez train_index et val_index pour appeler les bons indices de X et y lors de la création des ensembles d'entraînement et de validation.
  • Ajustez rfc en utilisant l'ensemble d'entraînement.
  • Utilisez rfc pour générer des prédictions sur l'ensemble de validation et affichez la justesse de validation.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error

rfc = RandomForestRegressor(n_estimators=25, random_state=1111)

# Access the training and validation indices of splits
for train_index, val_index in splits:
    # Setup the training and validation data
    X_train, y_train = X[____], y[____]
    X_val, y_val = X[____], y[____]
    # Fit the random forest model
    rfc.____(____, ____)
    # Make predictions, and print the accuracy
    predictions = rfc.____(____)
    print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))
Modifier et exécuter le code