Відстежте кошти
У цій вправі ви працюєте з іншою версією датафрейму banking, яка містить пропущені значення як у стовпці cust_id, так і в стовпці acct_amount.
Ви хочете проаналізувати, скільки у банку унікальних клієнтів, середню суму на рахунках клієнтів тощо. Ви розумієте, що рядки з відсутніми cust_id не допоможуть у цьому, а в середньому acct_amount зазвичай у 5 разів перевищує inv_amount.
У цій вправі ви видалите з banking рядки з пропущеними cust_id, а також імпутуєте пропущені значення acct_amount, використовуючи галузеві знання.
Ця вправа є частиною курсу
Очищення даних у Python
Інструкції до вправи
- Використайте
.dropna(), щоб видалити пропущені значення у стовпціcust_idвbanking, і збережіть результат уbanking_fullid. - Використайте
inv_amount, щоб обчислити оцінені суми на рахунках дляbanking_fullid, встановивши суми рівнимиinv_amount * 5, і запишіть результат уacct_imp. - Імпутуйте пропущені значення
acct_amountуbanking_fullidщойно створенимacct_imp, використовуючи.fillna().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])
# Compute estimated acct_amount
acct_imp = ____
# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})
# Print number of missing values
print(banking_imputed.isna().sum())