Задайте пользовательские значения NA
Исследование и очистка данных включают проверку пропущенных и NA-значений, а также принятие решений о том, как с ними работать. Это проще делать, когда пропущенные значения выделены в отдельный тип данных: в pandas есть функции, которые работают именно с такими NA-значениями. По умолчанию pandas распознаёт некоторые значения как пропущенные, но с помощью аргумента na_values можно добавить дополнительные индикаторы NA. В этом упражнении вы воспользуетесь этой возможностью, чтобы некорректные почтовые индексы в данных по налогам штата Вермонт были помечены как NA.
pandas импортирован как pd.
Это упражнение является частью курса
Эффективный импорт данных с pandas
Инструкции к упражнению
- Создайте словарь
null_values, указав, что значения0в столбцеzipcodeдолжны считаться NA. - Загрузите файл
vt_tax_data_2016.csv, используя аргументna_valuesи созданный словарь, чтобы некорректные почтовые индексы обрабатывались как пропущенные значения.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])