Populacja zgodna z harmonogramem
Załóżmy, że chcesz zbudować tabelę bazową dla modelu predykcyjnego, który przewiduje, czy darczyńcy przekażą darowiznę w 2018 roku. Harmonogram wskazuje, że populacja powinna obejmować wszystkich darczyńców, którzy dokonali co najmniej jednej darowizny od 1 stycznia 2013 roku, ale nie dokonali żadnej darowizny po 1 stycznia 2017 roku.
Dane wejściowe stanowi ramka danych pandas gifts zawierająca wszystkie darowizny od 2010 roku. W tym ćwiczeniu zbudujesz zbiór z identyfikatorami darczyńców należących do populacji.
To ćwiczenie jest częścią kursu
Pośrednia analityka predykcyjna w Pythonie
Instrukcje do ćwiczenia
- Utwórz ramkę danych
gifts_includezawierającą wszystkie darowizny z 2013 roku lub późniejsze oraz ramkę danychgifts_excludezawierającą wszystkie darowizny z 2017 roku lub późniejsze. - Utwórz zbiór
donors_includez identyfikatorami darczyńców zgifts_includeoraz zbiórdonors_excludez identyfikatorami darczyńców zgifts_exclude. - Skonstruuj populację, używając metody
.difference()na dwóch utworzonych zbiorach.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Gifts made in 2013 or later
gifts_include = ____[____[____].dt.year >= ____]
# Gifts made in 2017 or later
gifts_exclude = ____[____[____].dt.year >= ____]
# Set with ids in gifts_include
donors_include = ____(____[____])
# Set with ids in gifts_exclude
donors_exclude = ____(____[____])
# Population
population = ____.difference(____)
print(len(population))