En tidslinjekomplett population
Anta att du vill konstruera en basztabell för en prediktiv modell som förutsäger om givare kommer att donera under 2018. Tidslinjen anger att populationen ska innehålla alla givare som donerade minst en gång sedan den 1 januari 2013, men som inte gjorde några donationer efter den 1 januari 2017.
Du har tillgång till en pandas-dataram gifts med alla donationer sedan 2010. I den här övningen ska du konstruera en mängd med givar-id för alla givare i populationen.
Den här övningen är en del av kursen
Prediktiv analys på mellannivå i Python
Övningsinstruktioner
- Konstruera en dataram
gifts_includesom innehåller alla donationer gjorda 2013 eller senare, och en dataramgifts_excludesom innehåller alla donationer gjorda 2017 eller senare. - Konstruera en mängd
donors_includemed givar-id för alla givare igifts_include, och en mängddonors_excludemed givar-id för alla givare igifts_exclude. - Konstruera populationen med hjälp av metoden
.difference()på dina två mängder.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Gifts made in 2013 or later
gifts_include = ____[____[____].dt.year >= ____]
# Gifts made in 2017 or later
gifts_exclude = ____[____[____].dt.year >= ____]
# Set with ids in gifts_include
donors_include = ____(____[____])
# Set with ids in gifts_exclude
donors_exclude = ____(____[____])
# Population
population = ____.difference(____)
print(len(population))