Följ pengarna
I den här övningen arbetar du med en annan version av DataFrame:n banking som innehåller saknade värden i både kolumnen cust_id och kolumnen acct_amount.
Du vill analysera hur många unika kunder banken har, det genomsnittliga beloppet per kund och mer. Du vet att rader med saknade cust_id inte är till någon hjälp, och att acct_amount i genomsnitt brukar vara 5 gånger värdet av inv_amount.
I den här övningen tar du bort rader i banking där cust_id saknas och imputerar saknade värden i acct_amount med hjälp av domänkunskap.
Den här övningen är en del av kursen
Datarensning i Python
Övningsinstruktioner
- Använd
.dropna()för att ta bort rader med saknade värden i kolumnencust_idibankingoch lagra resultatet ibanking_fullid. - Använd
inv_amountför att beräkna de uppskattade kontobeloppen förbanking_fullidgenom att sätta beloppen tillinv_amount * 5, och tilldela resultatet tillacct_imp. - Imputera de saknade värdena i
acct_amountibanking_fullidmed det nyligen skapadeacct_impmed hjälp av.fillna().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])
# Compute estimated acct_amount
acct_imp = ____
# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})
# Print number of missing values
print(banking_imputed.isna().sum())