여러 파일 스캔하기
팀의 대출 데이터가 이제 연도별 CSV 파일(seattle_2021.csv, seattle_2022.csv, seattle_2023.csv)로 나뉘어 저장되어 있습니다. 각 파일에는 레거시 컬럼명인 usageclass와 materialtype이 사용됩니다. glob 패턴을 사용해 모든 파일을 하나의 논리적 데이터셋으로 스캔한 후, 실물 대출 요약 결과를 만들어 보세요.
polars는 pl로 로드되어 있으며, 디렉토리 경로는 MULTIFILE_DIR에 저장되어 있습니다.
이 연습은 강의의 일부입니다
Polars로 데이터 파이프라인 확장 및 최적화하기
연습 안내
- glob 패턴을 사용해
MULTIFILE_DIR에 있는 모든seattle_*.csv파일을 스캔하세요. - 결합된 데이터셋에서
"Physical"대출 항목을 필터링한 후,materialtype을 기준으로 그룹화하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)