Kom igångKom igång gratis

Följ pengarna

I den här övningen arbetar du med en annan version av DataFrame:n banking som innehåller saknade värden i både kolumnen cust_id och kolumnen acct_amount.

Du vill analysera hur många unika kunder banken har, det genomsnittliga beloppet per kund och mer. Du vet att rader med saknade cust_id inte är till någon hjälp, och att acct_amount i genomsnitt brukar vara 5 gånger värdet av inv_amount.

I den här övningen tar du bort rader i banking där cust_id saknas och imputerar saknade värden i acct_amount med hjälp av domänkunskap.

Den här övningen är en del av kursen

Datarensning i Python

Visa kurs

Övningsinstruktioner

  • Använd .dropna() för att ta bort rader med saknade värden i kolumnen cust_id i banking och lagra resultatet i banking_fullid.
  • Använd inv_amount för att beräkna de uppskattade kontobeloppen för banking_fullid genom att sätta beloppen till inv_amount * 5, och tilldela resultatet till acct_imp.
  • Imputera de saknade värdena i acct_amount i banking_fullid med det nyligen skapade acct_imp med hjälp av .fillna().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])

# Compute estimated acct_amount
acct_imp = ____

# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})

# Print number of missing values
print(banking_imputed.isna().sum())
Redigera och kör kod