НачатьНачать бесплатно

Задайте пользовательские значения NA

Исследование и очистка данных включают проверку пропущенных и NA-значений, а также принятие решений о том, как с ними работать. Это проще делать, когда пропущенные значения выделены в отдельный тип данных: в pandas есть функции, которые работают именно с такими NA-значениями. По умолчанию pandas распознаёт некоторые значения как пропущенные, но с помощью аргумента na_values можно добавить дополнительные индикаторы NA. В этом упражнении вы воспользуетесь этой возможностью, чтобы некорректные почтовые индексы в данных по налогам штата Вермонт были помечены как NA.

pandas импортирован как pd.

Это упражнение является частью курса

Эффективный импорт данных с pandas

Посмотреть курс

Инструкции к упражнению

  • Создайте словарь null_values, указав, что значения 0 в столбце zipcode должны считаться NA.
  • Загрузите файл vt_tax_data_2016.csv, используя аргумент na_values и созданный словарь, чтобы некорректные почтовые индексы обрабатывались как пропущенные значения.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create dict specifying that 0s in zipcode are NA values
null_values = {____}

# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv", 
                   ____)

# View rows with NA ZIP codes
print(data[data.zipcode.isna()])
Редактировать и запускать код