시작하기무료로 시작하기

사용자 지정 NA 값 설정

데이터 탐색과 정제의 일부는 누락값(NA)을 확인하고 이를 어떻게 처리할지 결정하는 일이에요. 누락값을 고유한 데이터 타입으로 다루면 더 수월하고, 이러한 NA 값을 겨냥하는 pandas 함수들도 있어요. pandas는 일부 값을 자동으로 누락으로 처리하지만, na_values 인수로 추가적인 NA 표시값을 전달할 수 있어요. 여기서는 Vermont 세금 데이터에서 잘못된 우편번호(ZIP code)가 NA로 인코딩되도록 설정해 보겠습니다.

pandaspd로 임포트되어 있어요.

이 연습은 강의의 일부입니다

pandas로 빠르고 간편한 데이터 적재

강의 보기

연습 안내

  • 딕셔너리 null_values를 만들어 zipcode 열의 0이 NA 값으로 간주되도록 지정하세요.
  • vt_tax_data_2016.csv를 불러올 때 na_values 인수와 위 딕셔너리를 사용해 잘못된 ZIP 코드를 누락값으로 처리하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create dict specifying that 0s in zipcode are NA values
null_values = {____}

# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv", 
                   ____)

# View rows with NA ZIP codes
print(data[data.zipcode.isna()])
코드 편집 및 실행