Quét một tập dữ liệu phân vùng theo kiểu hive
Nhóm cũng lưu các file Parquet đã làm sạch theo bố cục phân vùng kiểu hive, mỗi năm một thư mục (checkoutyear=2023/, checkoutyear=2024/). Hãy quét (scan) tập dữ liệu đã phân vùng và lọc theo cột phân vùng để Polars chỉ đọc các năm bạn thực sự cần.
polars đã được nạp là pl, và thư mục gốc nằm trong HIVE_DIR. Các thư mục phân vùng đã được in ra sẵn để bạn thấy bố cục.
Bài tập này là một phần của khóa học
Mở rộng và tối ưu hóa pipeline dữ liệu với Polars
Hướng dẫn bài tập
- Quét
HIVE_DIRvới tham số phù hợp để bật hive partitioning. - Lọc kết quả để lấy các lượt checkout từ năm 2024 trở đi.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
requests = pl.scan_parquet(
HIVE_DIR,
# Enable hive partitioning
____=True,
)
result = (
requests
# Filter to the 2024 partition
.filter(pl.col("checkoutyear") >= ____)
.group_by("format")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)