Прогнозування відтоку за допомогою дерева рішень
Тепер ви спиратиметеся на навички з попередньої вправи та побудуєте складніше дерево рішень із додатковими параметрами для прогнозування відтоку клієнтів. У наступному розділі ви детальніше зануритеся в задачу прогнозування відтоку. Тут ви знову запустите класифікатор дерева рішень на тренувальних даних, спрогнозуєте рівень відтоку на невидимих (тестових) даних і оціните точність моделі на обох наборах даних.
Модуль tree з бібліотеки sklearn уже імпортовано для вас, так само як і функцію accuracy_score з sklearn.metrics. Ознаки та цільові змінні також імпортовано як train_X, train_Y для тренувальних даних і test_X, test_Y для тестових даних.
Ця вправа є частиною курсу
Machine Learning для маркетингу в Python
Інструкції до вправи
- Ініціалізуйте Decision tree з максимальною глибиною 7 і з критерієм gini.
- Навчіть модель на тренувальних даних.
- Спрогнозуйте значення на тестовому наборі даних.
- Виведіть значення точності для тренувального й тестового наборів даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))