Arbres de décision
Votre tâche dans cet exercice est de créer un arbre de décision simple en utilisant le DecisionTreeClassifier de scikit-learn sur l'ensemble de données breast cancer fourni avec scikit-learn.
Cet ensemble contient des mesures numériques de diverses dimensions de tumeurs individuelles (comme le périmètre et la texture) issues de biopsies mammaires, ainsi qu'une valeur de résultat unique (la tumeur est maligne ou bénigne).
Nous avons préchargé l'ensemble de mesures dans X et les valeurs cibles par tumeur dans y. Vous devez maintenant fractionner l'ensemble complet en ensembles d'entraînement et de test, puis entraîner un DecisionTreeClassifier. Vous indiquerez un paramètre appelé max_depth. De nombreux autres paramètres peuvent être modifiés dans ce modèle, et vous pouvez tous les consulter ici.
Cette activité fait partie du cours
Amorçage de gradient avancé avec XGBoost
Instructions de l’exercice
- Importez :
train_test_splitdepuissklearn.model_selection.DecisionTreeClassifierdepuissklearn.tree.
- Créez les ensembles d'entraînement et de test de sorte que 20 % des données soient utilisées pour le test. Utilisez un
random_statede123. - Instanciez un
DecisionTreeClassifiernommédt_clf_4avec unmax_depthde4. Ce paramètre précise le nombre maximal de points de division successifs permis avant d'atteindre une feuille. - Ajustez le classificateur à l'ensemble d'entraînement et prédisez les étiquettes de l'ensemble de test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the necessary modules
____
____
# Create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=____, random_state=____)
# Instantiate the classifier: dt_clf_4
dt_clf_4 = ____
# Fit the classifier to the training set
____
# Predict the labels of the test set: y_pred_4
y_pred_4 = ____
# Compute the accuracy of the predictions: accuracy
accuracy = float(np.sum(y_pred_4==y_test))/y_test.shape[0]
print("accuracy:", accuracy)