НачатьНачать бесплатно

Удаление дублирующихся объектов

Предположим, что вы строите прогностическую модель для отбора доноров, которые с наибольшей вероятностью откликнутся на письмо. В популяцию базовой таблицы должны входить только те доноры, у которых есть доступный адрес и чьи настройки конфиденциальности разрешают отправку писем. Все доноры-кандидаты представлены в датафрейме donors, содержащем три столбца: donor_id — идентификатор донора, address — флаг, равный 1, если адрес доступен, и 0 в противном случае, а также letter_allowed — флаг, равный 1, если донору можно отправить письмо, и 0 в противном случае. В этом упражнении вы сформируете множество доноров, которые должны войти в популяцию.

Это упражнение является частью курса

Средний уровень прогностической аналитики на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте датафрейм donors_population, содержащий только тех доноров, у которых есть доступный адрес и которым разрешена отправка писем.
  • Создайте список с идентификаторами доноров из donors_population.
  • Сформируйте итоговую популяцию и определите количество доноров в ней.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a dataframe donors_population
donors_population = ____[(____["____"] == ____) & (____["____"] == ____)]

# Create a list of donor IDs
population_list = ____(____["____"])

# Select unique donors in population_list
population = ____(____)
print(len(population))
Редактировать и запускать код