정제된 추출 데이터를 Parquet으로 저장하기
시애틀 도서관 데이터로 다시 돌아가 보겠습니다. 팀에서 다운스트림 도구에 활용하기 위해 정제된 대출 추출 데이터를 Parquet 형식으로 저장하려 합니다. 단, 전체 데이터를 메모리에 먼저 올리지 않고 바로 디스크에 기록해야 합니다. 지연 쿼리에서 직접 디스크로 저장해 보세요.
clean_checkouts는 내보내기 경로 CLEAN_EXPORT_PATH와 함께 미리 로드되어 있습니다.
이 연습은 강의의 일부입니다
Polars로 데이터 파이프라인 확장 및 최적화하기
연습 안내
- 지연 쿼리에서 직접
clean_checkouts를CLEAN_EXPORT_PATH에 저장하세요. - 행 그룹 크기를 5,000으로 설정하세요.
- 스트리밍 엔진을 사용하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)