Hur är vår dataintegritet?
Nya data har sammanfogats med DataFrame-objektet banking. Det innehåller information om hur investeringar i kolumnen inv_amount fördelas över fyra olika fonder: A, B, C och D.
Dessutom lagras nu kundernas ålder och födelsedag i kolumnerna age respektive birth_date.
Du vill förstå hur kunder i olika åldersgrupper investerar, men du vill först kontrollera att datan du analyserar är korrekt. Det gör du genom att korsfältvalidera värdena i inv_amount och age mot de investerade beloppen i de olika fonderna och kundernas födelsdagar.
Både pandas och datetime har importerats som pd respektive dt.
Den här övningen är en del av kursen
Datarensning i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']
# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____
# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]
# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])