Точность и полнота
Точность (precision) и полнота (recall) связаны с четырьмя исходами, которые рассматривались в предыдущем уроке, и являются важными метриками оценки любой модели машинного обучения. Для модели CTR рекламы в идеале нужны высокая точность (высокий ROI от рекламных расходов) и высокая полнота (охват релевантной аудитории). Вычислить эти метрики можно вручную, однако sklearn предоставляет удобные реализации, которые легко встроить в существующий рабочий процесс. В этом упражнении вы настроите дерево решений и вычислите точность и полноту.
Модуль pandas доступен как pd, а исходный DataFrame загружен как df. Признаки загружены в X, а целевая переменная — в y. Функции precision_score() и recall_score() из sklearn.metrics уже доступны в вашем рабочем пространстве.
Это упражнение является частью курса
Прогнозирование CTR с помощью машинного обучения на Python
Инструкции к упражнению
- Разбейте
Xиyна обучающую и тестовую выборки. - Определите классификатор на основе дерева решений и получите предсказания
y_pred, обучив модель. - Используйте реализации из
sklearn, чтобы вычислить значения точности и полноты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Set up training and testing split
X_train, X_test, y_train, y_test = ____(
____, ____, test_size = .2, random_state = 0)
# Create classifier and make predictions
clf = ____
y_pred = clf.____(____, _____).____(X_test)
# Evaluate precision and recall
prec = ____(y_test, ____, average = 'weighted')
recall = ____(y_test, ____, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))