ПочатиПочніть безкоштовно

Вилучення дубльованих об'єктів

Припустімо, ви хочете побудувати прогностичну модель, щоб відібрати донорів, які з найбільшою ймовірністю відреагують на лист. Генеральна сукупність базової таблиці має містити донорів, для яких доступна адреса та чиї налаштування конфіденційності дозволяють надсилати їм листи. Усі кандидатні донори подані в датафреймі donors із трьома стовпцями: donor_id, прапорець address, що дорівнює 1, якщо адреса доступна, і 0 – інакше, та прапорець letter_allowed, що дорівнює 1, якщо цьому донору можна надіслати лист, і 0 – інакше. У цій вправі ви сформуєте множину донорів, які мають увійти до генеральної сукупності.

Ця вправа є частиною курсу

Середній рівень Predictive Analytics у Python

Переглянути курс

Інструкції до вправи

  • Створіть датафрейм donors_population, що містить лише спостереження з доступною адресою і для яких надсилання листа дозволено.
  • Створіть список, що містить ідентифікатори донорів у donors_population.
  • Побудуйте остаточну генеральну сукупність і підрахуйте кількість донорів у ній.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a dataframe donors_population
donors_population = ____[(____["____"] == ____) & (____["____"] == ____)]

# Create a list of donor IDs
population_list = ____(____["____"])

# Select unique donors in population_list
population = ____(____)
print(len(population))
Редагувати та запускати код