設定自訂 NA 值
資料探索與清理的一部分,就是檢查遺漏或 NA 值並決定如何處理。當把遺漏值視為獨立的資料型別時,這會更容易,因為有些 pandas 函式是專門用來處理這類 NA 值的。pandas 會自動把某些值視為遺漏,但我們也能用 na_values 參數傳入額外的 NA 指示器。在這裡,你要這麼做,確保在 Vermont 稅務資料中的無效 ZIP code 會被標記為 NA。
pandas 已匯入為 pd。
本練習屬於課程
使用 pandas 的精實資料導入
練習說明
- 建立一個字典
null_values,指定在zipcode欄中的0應視為 NA 值。 - 載入
vt_tax_data_2016.csv,使用na_values參數與該字典,確保無效的 ZIP code 被視為遺漏值。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])