Parquet स्नैपशॉट लिखना
एक डाउनस्ट्रीम डैशबोर्ड को डिजिटल ईबुक गतिविधि का हल्का Parquet स्नैपशॉट चाहिए. परिणाम को lazily बनाइए, फिर उसे तेज़ रीड के लिए फ़ाइल ट्यून करने हेतु स्पष्ट compression और row group सेटिंग्स के साथ वापस लिखिए.
LazyFrame requests उपलब्ध है, और export path PARQUET_EXPORT_PATH में है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Polars के साथ Data Pipelines का स्केलिंग और ऑप्टिमाइज़ेशन
अभ्यास निर्देश
- स्नैपशॉट के लिए केवल पहली 500 डिजिटल पंक्तियाँ रखें.
- Parquet फ़ाइल लिखते समय
compression_levelको5पर सेट करें. row_group_sizeको250पंक्तियों पर सेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
result = (
requests
.filter(pl.col("use") == "Digital")
.select("date", "format", "checkouts", "title")
# Keep only the first 500 rows
.____(500)
.collect()
)
result.write_parquet(
PARQUET_EXPORT_PATH,
# Set compression level to 5
compression_level=____,
# Set 250 rows per row group
row_group_size=____,
)
print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))