设置自定义 NA 值
数据探索与清洗的一部分,是检查缺失或 NA 值,并决定如何处理它们。若将缺失值作为独立的数据类型处理,这会更容易,而且有一些 pandas 函数可以专门针对这些 NA 值。pandas 会自动将某些值视为缺失,但我们可以通过 na_values 参数额外传入 NA 标记。在这里,您将这样做,以确保佛蒙特州税务数据中的无效邮编被编码为 NA。
已将 pandas 以 pd 导入。
本练习是课程的一部分
使用 pandas 高效导入数据
练习说明
- 创建一个字典
null_values,指定zipcode列中的0应被视为 NA 值。 - 加载
vt_tax_data_2016.csv,使用na_values参数和该字典,确保无效邮编被视为缺失值。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])