Прогнозирование оттока с помощью дерева решений
Теперь вы применим навыки, полученные в предыдущем упражнении, и построим более сложное дерево решений с дополнительными параметрами для прогнозирования оттока клиентов. В следующей главе мы подробно рассмотрим задачу прогнозирования оттока. В этом упражнении вы снова запустите классификатор на основе дерева решений, обучив его на тренировочных данных, затем спрогнозируете отток на новых (тестовых) данных и оцените точность модели на обоих наборах.
Модуль tree из библиотеки sklearn, а также функция accuracy_score из sklearn.metrics уже загружены. Признаки и целевые переменные также импортированы: train_X, train_Y — для обучающей выборки, test_X, test_Y — для тестовой.
Это упражнение является частью курса
Машинное обучение для маркетинга на Python
Инструкции к упражнению
- Инициализируйте дерево решений с максимальной глубиной 7 и критерием Джини.
- Обучите модель на тренировочных данных.
- Получите прогнозы на тестовом наборе данных.
- Выведите значения точности для обучающей и тестовой выборок.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))