CommencezCommencez gratuitement

Entraînez votre premier arbre de classification

Dans cet exercice, vous allez travailler avec le jeu de données Wisconsin Breast Cancer du référentiel UCI de Machine Learning. Vous prédirez si une tumeur est maligne ou bénigne à partir de deux variables : le rayon moyen de la tumeur (radius_mean) et son nombre moyen de points concaves (concave points_mean).

Le jeu de données est déjà chargé dans votre espace de travail et est séparé en 80 % entraînement et 20 % test. Les matrices de caractéristiques sont assignées à X_train et X_test, tandis que les tableaux d'étiquettes sont assignés à y_train et y_test, où la classe 1 correspond à une tumeur maligne et la classe 0 à une tumeur bénigne. Pour obtenir des résultats reproductibles, nous avons aussi défini une variable appelée SEED dont la valeur est 1.

Cette activité fait partie du cours

Machine Learning avec des modèles à base d'arbres en Python

Voir le cours

Instructions de l’exercice

  • Importez DecisionTreeClassifier depuis sklearn.tree.

  • Instanciez un DecisionTreeClassifier dt avec une profondeur maximale égale à 6.

  • Ajustez dt à l'ensemble d'entraînement.

  • Prédisez les étiquettes de l'ensemble de test et assignez le résultat à y_pred.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____

# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)

# Fit dt to the training set
____.____(____, ____)

# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])
Modifier et exécuter le code