Удаление дублирующихся объектов
Предположим, что вы строите прогностическую модель для отбора доноров, которые с наибольшей вероятностью откликнутся на письмо. В популяцию базовой таблицы должны входить только те доноры, у которых есть доступный адрес и чьи настройки конфиденциальности разрешают отправку писем.
Все доноры-кандидаты представлены в датафрейме donors, содержащем три столбца: donor_id — идентификатор донора, address — флаг, равный 1, если адрес доступен, и 0 в противном случае, а также letter_allowed — флаг, равный 1, если донору можно отправить письмо, и 0 в противном случае.
В этом упражнении вы сформируете множество доноров, которые должны войти в популяцию.
Это упражнение является частью курса
Средний уровень прогностической аналитики на Python
Инструкции к упражнению
- Создайте датафрейм
donors_population, содержащий только тех доноров, у которых есть доступный адрес и которым разрешена отправка писем. - Создайте список с идентификаторами доноров из
donors_population. - Сформируйте итоговую популяцию и определите количество доноров в ней.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a dataframe donors_population
donors_population = ____[(____["____"] == ____) & (____["____"] == ____)]
# Create a list of donor IDs
population_list = ____(____["____"])
# Select unique donors in population_list
population = ____(____)
print(len(population))