Навчіть своє перше дерево класифікації
У цій вправі ви працюватимете з Wisconsin Breast Cancer Dataset з репозиторію машинного навчання UCI. Ви передбачатимете, чи є пухлина злоякісною (malignant), чи доброякісною (benign) на основі двох ознак: середнього радіуса пухлини (radius_mean) та середньої кількості увігнутих точок (concave points_mean).
Набір даних уже завантажено у ваш робочий простір і поділено на 80% тренувальних та 20% тестових даних. Матриці ознак збережено в X_train і X_test, а масиви міток — у y_train і y_test, де клас 1 відповідає злоякісній пухлині, а клас 0 — доброякісній. Щоб отримати відтворювані результати, ми також визначили змінну SEED, значення якої дорівнює 1.
Ця вправа є частиною курсу
Машинне навчання з деревоподібними моделями в Python
Інструкції до вправи
Імпортуйте
DecisionTreeClassifierзsklearn.tree.Створіть екземпляр
DecisionTreeClassifierdtз максимальною глибиною 6.Навчіть
dtна тренувальній вибірці.Передбачте мітки тестової вибірки та збережіть результат у
y_pred.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____
# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)
# Fit dt to the training set
____.____(____, ____)
# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])