顺藤摸"资"
在本练习中,您将使用另一个版本的 banking DataFrame,其中 cust_id 列和 acct_amount 列都包含缺失值。
您希望分析银行拥有的唯一客户数量、客户持有金额的平均值等。您知道,缺少 cust_id 的行对分析没有帮助,并且通常 acct_amount 的平均水平大约是 inv_amount 的 5 倍。
在本练习中,您将删除 banking 中 cust_id 缺失的行,并基于领域知识对缺失的 acct_amount 进行填补。
本练习是课程的一部分
Python 数据清洗
练习说明
- 使用
.dropna()删除banking中cust_id列的缺失值,将结果保存为banking_fullid。 - 使用
inv_amount估算banking_fullid的账户金额,令其等于inv_amount * 5,并将结果赋给acct_imp。 - 使用
.fillna()将banking_fullid中acct_amount的缺失值用新创建的acct_imp进行填补。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])
# Compute estimated acct_amount
acct_imp = ____
# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})
# Print number of missing values
print(banking_imputed.isna().sum())