НачатьНачать бесплатно

Создание новых признаков

Разработка признаков включает в себя и непосредственное создание новых признаков. Это важно, поскольку модель опирается на них при формировании точных предсказаний. В этом упражнении вы изучите свойства трёх столбцов, которые представлены как целые числа, но по своей природе являются категориальными: search_engine_type, product_type и advertiser_type. Вы создадите счётные признаки для этих трёх столбцов, а также для device_id и site_id. Такие признаки отражают количество кликов для каждого из столбцов и будут использоваться в дальнейшем для предсказания.

Модуль pandas доступен как pd, а обучающий DataFrame загружен как df.

Это упражнение является частью курса

Прогнозирование CTR с помощью машинного обучения на Python

Посмотреть курс

Инструкции к упражнению

  • Выведите общее количество значений и количество уникальных значений для каждого признака из списка feature_list.
  • Создайте новые признаки на основе столбцов из списка new_feature_list, подсчитав количество кликов для каждого признака с помощью метода .transform().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Get counts of total and unique values for given features
feature_list = ["search_engine_type", "product_type", "advertiser_type"]
for feature in feature_list:
	print(df[feature].____)
	print(df[feature].____)

# Define new features as counts
new_feature_list = ['device_id', 'site_id'] + feature_list
for new_feature in new_feature_list:
  df[new_feature + '_count'] = df.____(
    new_feature)['click'].____("count")
print(df.head(5))
Редактировать и запускать код