시작하기무료로 시작하기

여러 파일 스캔하기

팀의 대출 데이터가 이제 연도별 CSV 파일(seattle_2021.csv, seattle_2022.csv, seattle_2023.csv)로 나뉘어 저장되어 있습니다. 각 파일에는 레거시 컬럼명인 usageclassmaterialtype이 사용됩니다. glob 패턴을 사용해 모든 파일을 하나의 논리적 데이터셋으로 스캔한 후, 실물 대출 요약 결과를 만들어 보세요.

polarspl로 로드되어 있으며, 디렉토리 경로는 MULTIFILE_DIR에 저장되어 있습니다.

이 연습은 강의의 일부입니다

Polars로 데이터 파이프라인 확장 및 최적화하기

강의 보기

연습 안내

  • glob 패턴을 사용해 MULTIFILE_DIR에 있는 모든 seattle_*.csv 파일을 스캔하세요.
  • 결합된 데이터셋에서 "Physical" 대출 항목을 필터링한 후, materialtype을 기준으로 그룹화하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
코드 편집 및 실행