НачатьНачать бесплатно

Следуйте за деньгами

В этом упражнении вы работаете с другой версией DataFrame banking, которая содержит пропущенные значения в столбцах cust_id и acct_amount.

Вы хотите проанализировать, сколько уникальных клиентов есть у банка, какова средняя сумма на счетах и многое другое. Вы знаете, что строки с пропущенным cust_id не несут полезной информации, а среднее значение acct_amount обычно в 5 раз превышает значение inv_amount.

В этом упражнении вы удалите строки с пропущенными значениями cust_id из DataFrame banking, а пропуски в столбце acct_amount заполните с помощью экспертных знаний о предметной области.

Это упражнение является частью курса

Очистка данных в Python

Посмотреть курс

Инструкции к упражнению

  • Используйте .dropna(), чтобы удалить строки с пропущенными значениями в столбце cust_id из DataFrame banking, и сохраните результат в banking_fullid.
  • Используйте inv_amount, чтобы вычислить расчётные суммы на счетах для banking_fullid: установите значения равными inv_amount * 5 и сохраните результат в acct_imp.
  • Заполните пропущенные значения столбца acct_amount в banking_fullid с помощью метода .fillna(), используя только что созданный acct_imp.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])

# Compute estimated acct_amount
acct_imp = ____

# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})

# Print number of missing values
print(banking_imputed.isna().sum())
Редактировать и запускать код