Вилучення дубльованих об'єктів
Припустімо, ви хочете побудувати прогностичну модель, щоб відібрати донорів, які з найбільшою ймовірністю відреагують на лист. Генеральна сукупність базової таблиці має містити донорів, для яких доступна адреса та чиї налаштування конфіденційності дозволяють надсилати їм листи.
Усі кандидатні донори подані в датафреймі donors із трьома стовпцями: donor_id, прапорець address, що дорівнює 1, якщо адреса доступна, і 0 – інакше, та прапорець letter_allowed, що дорівнює 1, якщо цьому донору можна надіслати лист, і 0 – інакше.
У цій вправі ви сформуєте множину донорів, які мають увійти до генеральної сукупності.
Ця вправа є частиною курсу
Середній рівень Predictive Analytics у Python
Інструкції до вправи
- Створіть датафрейм
donors_population, що містить лише спостереження з доступною адресою і для яких надсилання листа дозволено. - Створіть список, що містить ідентифікатори донорів у
donors_population. - Побудуйте остаточну генеральну сукупність і підрахуйте кількість донорів у ній.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a dataframe donors_population
donors_population = ____[(____["____"] == ____) & (____["____"] == ____)]
# Create a list of donor IDs
population_list = ____(____["____"])
# Select unique donors in population_list
population = ____(____)
print(len(population))