Qu’en est-il de l’intégrité de nos données ?
De nouvelles données ont été fusionnées dans le DataFrame banking, contenant des détails sur la façon dont les placements de la colonne inv_amount sont répartis entre quatre fonds A, B, C et D.
De plus, l’âge et la date de naissance des clients sont maintenant enregistrés dans les colonnes age et birth_date, respectivement.
Vous souhaitez comprendre comment les clients de différents groupes d’âge investissent. Cependant, vous voulez d’abord vous assurer que les données que vous analysez sont exactes. Pour ce faire, vous allez effectuer une validation croisée des champs en comparant les valeurs de inv_amount et age avec les montants investis dans les différents fonds et avec les dates de naissance des clients.
pandas et datetime ont déjà été importés sous les alias pd et dt.
Cette activité fait partie du cours
Nettoyage des données en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']
# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____
# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]
# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])