शुरू करेंमुफ़्त में शुरू करें

क्लीन किए गए एक्सट्रैक्ट को Parquet में सिंक करना

सीएटल लाइब्रेरी डेटा पर वापस आते हैं. टीम के पास एक क्लीन किया हुआ checkout एक्सट्रैक्ट है जिसे वे डाउनस्ट्रीम टूल्स के लिए Parquet में लिखना चाहते हैं, लेकिन वे इसे पहले पूरी तरह मेमोरी में मटेरियलाइज़ नहीं करना चाहते. लेज़ी क्वेरी को सीधे डिस्क पर लिखिए.

clean_checkouts प्रीलोडेड है, साथ ही एक्सपोर्ट पाथ CLEAN_EXPORT_PATH भी.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Polars के साथ Data Pipelines का स्केलिंग और ऑप्टिमाइज़ेशन

पाठ्यक्रम देखें

अभ्यास निर्देश

  • लेज़ी क्वेरी से सीधे clean_checkouts को CLEAN_EXPORT_PATH पर लिखिए.
  • row group size को 5,000 सेट करें.
  • स्ट्रीमिंग इंजन का उपयोग करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Write clean_checkouts straight to disk
clean_checkouts.____(
    CLEAN_EXPORT_PATH,
    # 5,000 rows per row group
    row_group_size=____,
    # Streaming engine
    engine="____",
)

# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
    pl.len().alias("rows"),
    pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)
कोड संपादित करें और चलाएँ