Kom igångKom igång gratis

Hur är vår dataintegritet?

Nya data har sammanfogats med DataFrame-objektet banking. Det innehåller information om hur investeringar i kolumnen inv_amount fördelas över fyra olika fonder: A, B, C och D.

Dessutom lagras nu kundernas ålder och födelsedag i kolumnerna age respektive birth_date.

Du vill förstå hur kunder i olika åldersgrupper investerar, men du vill först kontrollera att datan du analyserar är korrekt. Det gör du genom att korsfältvalidera värdena i inv_amount och age mot de investerade beloppen i de olika fonderna och kundernas födelsdagar. Både pandas och datetime har importerats som pd respektive dt.

Den här övningen är en del av kursen

Datarensning i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']

# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____

# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]

# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])
Redigera och kör kod