Создание новых признаков
Разработка признаков включает в себя и непосредственное создание новых признаков. Это важно, поскольку модель опирается на них при формировании точных предсказаний. В этом упражнении вы изучите свойства трёх столбцов, которые представлены как целые числа, но по своей природе являются категориальными: search_engine_type, product_type и advertiser_type. Вы создадите счётные признаки для этих трёх столбцов, а также для device_id и site_id. Такие признаки отражают количество кликов для каждого из столбцов и будут использоваться в дальнейшем для предсказания.
Модуль pandas доступен как pd, а обучающий DataFrame загружен как df.
Это упражнение является частью курса
Прогнозирование CTR с помощью машинного обучения на Python
Инструкции к упражнению
- Выведите общее количество значений и количество уникальных значений для каждого признака из списка
feature_list. - Создайте новые признаки на основе столбцов из списка
new_feature_list, подсчитав количество кликов для каждого признака с помощью метода.transform().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Get counts of total and unique values for given features
feature_list = ["search_engine_type", "product_type", "advertiser_type"]
for feature in feature_list:
print(df[feature].____)
print(df[feature].____)
# Define new features as counts
new_feature_list = ['device_id', 'site_id'] + feature_list
for new_feature in new_feature_list:
df[new_feature + '_count'] = df.____(
new_feature)['click'].____("count")
print(df.head(5))