Первая модель предсказания CTR
В этом упражнении вы построите первую модель предсказания CTR на наборе данных Avazu с помощью дерева решений и оцените точность модели, используя accuracy_score() из sklearn. Кроме того, вы воспользуетесь функцией train_test_split() из sklearn, чтобы разделить данные на обучающую и тестовую выборки — вместо того чтобы задавать точку разделения вручную, как раньше.
В рабочей среде загружены выборочные данные в виде DataFrame под именем df, а также библиотеки sklearn и pandas как pd.
Мы выполним базовое разделение на обучающую и тестовую выборки и оценим результаты с помощью метрики точности.
Это упражнение является частью курса
Прогнозирование CTR с помощью машинного обучения на Python
Инструкции к упражнению
- Определите
Xиyкак признаки и целевую переменную соответственно, используя столбецclick. - Разделите данные на обучающую и тестовую выборки с помощью
train_test_split(X, y). - Создайте классификатор на основе дерева решений.
- Получите предсказания с помощью классификатора и оцените их точность.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define X and y
X = df.____[:, ~df.columns.____(['click'])]
y = df.click
# Define training and testing
X_train, X_test, y_train, y_test = \
____(____, _____, test_size = .2, random_state = 0)
# Create decision tree classifier
clf = ____()
# Train classifier - predict label and evaluate accuracy
y_pred = clf.fit(____, _____).____(X_test)
print(____(y_test, y_pred))