Обучите первое дерево классификации
В этом упражнении вы будете работать с набором данных Wisconsin Breast Cancer из репозитория UCI по машинному обучению. Ваша задача — предсказать, является ли опухоль злокачественной или доброкачественной, на основе двух признаков: среднего радиуса опухоли (radius_mean) и среднего числа вогнутых точек (concave points_mean).
Набор данных уже загружен в вашем рабочем пространстве и разделён на 80% обучающую и 20% тестовую выборки. Матрицы признаков записаны в X_train и X_test, а массивы меток — в y_train и y_test, где класс 1 соответствует злокачественной опухоли, а класс 0 — доброкачественной. Для воспроизводимости результатов также определена переменная SEED со значением 1.
Это упражнение является частью курса
Машинное обучение на основе древовидных моделей в Python
Инструкции к упражнению
Импортируйте
DecisionTreeClassifierизsklearn.tree.Создайте экземпляр
DecisionTreeClassifierс именемdtи максимальной глубиной, равной 6.Обучите
dtна обучающей выборке.Предскажите метки тестовой выборки и запишите результат в
y_pred.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____
# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)
# Fit dt to the training set
____.____(____, ____)
# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])