शुरू करेंमुफ़्त में शुरू करें

Parquet डेटा का सारांश

पहली Parquet-आधारित रिपोर्ट वही डिजिटल चेकआउट सारांश है जो टीम ने चैप्टर 1 में बनाया था, लेकिन अब scan_parquet क्वेरी से शुरू करते हुए. वही lazy पाइपलाइन बनाइए ताकि टीम अपने पूरे आर्काइव में इस पैटर्न को दोहरा सके.

Parquet फ़ाइल से बना LazyFrame requests आपके लिए पहले से तैयार है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Polars के साथ Data Pipelines का स्केलिंग और ऑप्टिमाइज़ेशन

पाठ्यक्रम देखें

अभ्यास निर्देश

  • requests को उन पंक्तियों तक फ़िल्टर करें जहाँ use "Digital" हो.
  • फ़िल्टर की गई पंक्तियों को format के आधार पर group करें.
  • execution को पाइपलाइन के बिलकुल अंत में ट्रिगर करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
कोड संपादित करें और चलाएँ