CommencezCommencez gratuitement

Une forêt d'arbres de décision

Dans cet exercice, vous allez pratiquer l'utilisation d'un arbre de décision avec rééchantillonnage bootstrap, aussi appelé Random Forest. Comme dans l'exercice précédent, vous comparerez ensuite sa justesse à celle d'un modèle dont vous aurez ajusté les hyperparamètres au moyen de la validation croisée.

Cette fois, vous allez ajuster un hyperparamètre supplémentaire, max_features, qui permet au modèle de déterminer combien de variables utiliser. Lorsqu'il n'est pas défini explicitement, sa valeur par défaut est auto. À garder en tête pour une entrevue : par défaut, les arbres de décision considèrent toutes les variables, tandis que les Random Forest considèrent généralement la racine carrée du nombre de variables.

La matrice des caractéristiques X, l'étiquette cible y et train_test_split de sklearn.model_selection ont été importées pour vous.

Cette activité fait partie du cours

S'exercer aux questions d'entrevue en Machine Learning avec Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import modules
from sklearn.ensemble import ____
from sklearn.metrics import accuracy_score

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)

# Instantiate, Fit, Predict
loans_rf = ____() 
loans_rf.____(____, ____)
y_pred = loans_rf.____(____)

# Evaluation metric
print("Random Forest Accuracy: {}".format(____(____,____)))
Modifier et exécuter le code