CommencezCommencez gratuitement

Créer un modèle de forêt aléatoire

Vous allez de nouveau travailler avec l'ensemble de données Pima Indians pour prédire si une personne est atteinte de diabète, cette fois avec un classificateur de forêt aléatoire. Vous entraînerez le modèle sur les données d'entraînement après avoir effectué la séparation entraînement-test, puis vous consulterez l'importance des variables.

Les ensembles de caractéristiques et cible ont été préchargés sous les noms X et y. Il en va de même pour les modules et fonctions nécessaires.

Cette activité fait partie du cours

Réduction de dimensionnalité en Python

Voir le cours

Instructions de l’exercice

  • Définissez une taille de test de 25 % afin d'obtenir une séparation entraînement-test de 75 %-25 %.
  • Entraînez le classificateur de forêt aléatoire sur les données d'entraînement.
  • Calculez la justesse (accuracy) sur l'ensemble de test.
  • Affichez l'importance des variables pour chaque caractéristique.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)

# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)

# Calculate the accuracy
acc = accuracy_score(____, ____)

# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))

# Print accuracy
print(f"{acc:.1%} accuracy on test set.") 
Modifier et exécuter le code