НачатьНачать бесплатно

Обучение дерева решений

Случайные леса — одна из лучших моделей для прогнозирования: они хорошо работают прямо «из коробки». Но сначала мы разберём их основу — деревья решений.

Деревья решений разбивают данные на группы по значениям признаков. Дерево начинается с корневого узла и последовательно разделяет данные вплоть до листовых узлов.

decision tree

Для обучения дерева решений можно использовать sklearn: класс DecisionTreeRegressor и метод .fit(features, targets).

Если не ограничивать глубину дерева, оно будет делить данные до тех пор, пока в каждом листе не останется по одному наблюдению, — это классический пример переобучения. Подробнее о переобучении мы поговорим в следующих главах.

Это упражнение является частью курса

Машинное обучение для финансов на Python

Посмотреть курс

Инструкции к упражнению

  • С помощью импортированного класса DecisionTreeRegressor без аргументов создайте модель дерева решений и назовите её decision_tree.
  • Обучите модель на данных train_features и train_targets, которые вы подготовили ранее (они содержат признаки дня недели и объёма торгов).
  • Выведите значение метрики качества на обучающих данных (train_features и train_targets), а также на тестовых (test_features и test_targets).

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from sklearn.tree import DecisionTreeRegressor

# Create a decision tree regression model with default arguments
decision_tree = ____

# Fit the model to the training features and targets
decision_tree.fit(____)

# Check the score on train and test
print(decision_tree.score(train_features, train_targets))
print(decision_tree.score(____))
Редактировать и запускать код