НачатьНачать бесплатно

Обучите первое дерево классификации

В этом упражнении вы будете работать с набором данных Wisconsin Breast Cancer из репозитория UCI по машинному обучению. Ваша задача — предсказать, является ли опухоль злокачественной или доброкачественной, на основе двух признаков: среднего радиуса опухоли (radius_mean) и среднего числа вогнутых точек (concave points_mean).

Набор данных уже загружен в вашем рабочем пространстве и разделён на 80% обучающую и 20% тестовую выборки. Матрицы признаков записаны в X_train и X_test, а массивы меток — в y_train и y_test, где класс 1 соответствует злокачественной опухоли, а класс 0 — доброкачественной. Для воспроизводимости результатов также определена переменная SEED со значением 1.

Это упражнение является частью курса

Машинное обучение на основе древовидных моделей в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте DecisionTreeClassifier из sklearn.tree.

  • Создайте экземпляр DecisionTreeClassifier с именем dt и максимальной глубиной, равной 6.

  • Обучите dt на обучающей выборке.

  • Предскажите метки тестовой выборки и запишите результат в y_pred.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____

# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)

# Fit dt to the training set
____.____(____, ____)

# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])
Редактировать и запускать код