क्लीन किए गए एक्सट्रैक्ट को Parquet में सिंक करना
सीएटल लाइब्रेरी डेटा पर वापस आते हैं. टीम के पास एक क्लीन किया हुआ checkout एक्सट्रैक्ट है जिसे वे डाउनस्ट्रीम टूल्स के लिए Parquet में लिखना चाहते हैं, लेकिन वे इसे पहले पूरी तरह मेमोरी में मटेरियलाइज़ नहीं करना चाहते. लेज़ी क्वेरी को सीधे डिस्क पर लिखिए.
clean_checkouts प्रीलोडेड है, साथ ही एक्सपोर्ट पाथ CLEAN_EXPORT_PATH भी.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Polars के साथ Data Pipelines का स्केलिंग और ऑप्टिमाइज़ेशन
अभ्यास निर्देश
- लेज़ी क्वेरी से सीधे
clean_checkoutsकोCLEAN_EXPORT_PATHपर लिखिए. - row group size को 5,000 सेट करें.
- स्ट्रीमिंग इंजन का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)