Следуйте за деньгами
В этом упражнении вы работаете с другой версией DataFrame banking, которая содержит пропущенные значения в столбцах cust_id и acct_amount.
Вы хотите проанализировать, сколько уникальных клиентов есть у банка, какова средняя сумма на счетах и многое другое. Вы знаете, что строки с пропущенным cust_id не несут полезной информации, а среднее значение acct_amount обычно в 5 раз превышает значение inv_amount.
В этом упражнении вы удалите строки с пропущенными значениями cust_id из DataFrame banking, а пропуски в столбце acct_amount заполните с помощью экспертных знаний о предметной области.
Это упражнение является частью курса
Очистка данных в Python
Инструкции к упражнению
- Используйте
.dropna(), чтобы удалить строки с пропущенными значениями в столбцеcust_idиз DataFramebanking, и сохраните результат вbanking_fullid. - Используйте
inv_amount, чтобы вычислить расчётные суммы на счетах дляbanking_fullid: установите значения равнымиinv_amount * 5и сохраните результат вacct_imp. - Заполните пропущенные значения столбца
acct_amountвbanking_fullidс помощью метода.fillna(), используя только что созданныйacct_imp.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])
# Compute estimated acct_amount
acct_imp = ____
# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})
# Print number of missing values
print(banking_imputed.isna().sum())