Suivez l’argent
Dans cet exercice, vous travaillez avec une autre version du DataFrame banking qui contient des valeurs manquantes pour les colonnes cust_id et acct_amount.
Vous souhaitez analyser le nombre de clients uniques de la banque, le montant moyen détenu par client, et plus encore. Vous savez que les lignes où cust_id est manquant ne vous aident pas vraiment et qu’en moyenne acct_amount correspond généralement à 5 fois le montant de inv_amount.
Dans cet exercice, vous supprimerez les lignes de banking dont le cust_id est manquant et vous imputerez les valeurs manquantes de acct_amount en vous appuyant sur vos connaissances du domaine.
Cette activité fait partie du cours
Nettoyage des données en Python
Instructions de l’exercice
- Utilisez
.dropna()pour supprimer les valeurs manquantes de la colonnecust_iddansbankinget stockez le résultat dansbanking_fullid. - Utilisez
inv_amountpour calculer les montants de compte estimés pourbanking_fulliden fixant ces montants àinv_amount * 5, et assignez le résultat àacct_imp. - Imputez les valeurs manquantes de
acct_amountdansbanking_fullidavec le nouveauacct_impà l’aide de.fillna().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])
# Compute estimated acct_amount
acct_imp = ____
# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})
# Print number of missing values
print(banking_imputed.isna().sum())