Вибір сукупності, сумісної з часовою шкалою
Припустімо, що ви хочете побудувати базову таблицю для прогностичної моделі, яка передбачає, чи робитимуть донори пожертви у 2018 році. Часова шкала вказує, що сукупність має містити всіх донорів, які зробили щонайменше одну пожертву з 1 січня 2013 року, але не робили пожертв після 1 січня 2017 року.
Надано датафрейм pandas gifts з усіма пожертвами, зробленими з 2010 року. У цій вправі ви сформуєте множину з ідентифікаторами донорів усіх донорів у сукупності.
Ця вправа є частиною курсу
Середній рівень Predictive Analytics у Python
Інструкції до вправи
- Створіть датафрейм
gifts_include, що містить усі пожертви, зроблені у 2013 році або пізніше, і датафреймgifts_exclude, що містить усі пожертви, зроблені у 2017 році або пізніше. - Створіть множину
donors_include, що містить усі ідентифікатори донорів ізgifts_include, і множинуdonors_exclude, що містить усі ідентифікатори донорів ізgifts_exclude. - Побудуйте сукупність за допомогою методу
.difference()на ваших двох множинах.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Gifts made in 2013 or later
gifts_include = ____[____[____].dt.year >= ____]
# Gifts made in 2017 or later
gifts_exclude = ____[____[____].dt.year >= ____]
# Set with ids in gifts_include
donors_include = ____(____[____])
# Set with ids in gifts_exclude
donors_exclude = ____(____[____])
# Population
population = ____.difference(____)
print(len(population))