"체크포인트"에서 데이터 파이프라인 검증하기
이 연습 문제에서는 CSV 파일에서 세금 데이터를 추출하고, 새 열을 만들고, 평균 과세 소득을 기준으로 행을 필터링한 뒤, 데이터를 parquet 파일로 저장하는 데이터 파이프라인을 다룹니다.
pandas는 pd로 로드되어 있으며, extract(), transform(), load() 함수가 이미 정의되어 있습니다. 이 함수들을 사용해 실행 과정의 여러 체크포인트에서 데이터 파이프라인을 검증해 보세요.
이 연습은 강의의 일부입니다
Python으로 ETL과 ELT
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")