Bắt đầu ngayBắt đầu miễn phí

Quét một tập dữ liệu phân vùng theo kiểu hive

Nhóm cũng lưu các file Parquet đã làm sạch theo bố cục phân vùng kiểu hive, mỗi năm một thư mục (checkoutyear=2023/, checkoutyear=2024/). Hãy quét (scan) tập dữ liệu đã phân vùng và lọc theo cột phân vùng để Polars chỉ đọc các năm bạn thực sự cần.

polars đã được nạp là pl, và thư mục gốc nằm trong HIVE_DIR. Các thư mục phân vùng đã được in ra sẵn để bạn thấy bố cục.

Bài tập này là một phần của khóa học

Mở rộng và tối ưu hóa pipeline dữ liệu với Polars

Xem khóa học

Hướng dẫn bài tập

  • Quét HIVE_DIR với tham số phù hợp để bật hive partitioning.
  • Lọc kết quả để lấy các lượt checkout từ năm 2024 trở đi.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Chỉnh sửa và Chạy Mã