बैचों में क्वेरी परिणाम प्रोसेस करना
टीम चाहती है कि डिजिटल checkout पंक्तियों को एक बड़े DataFrame के बजाय छोटे-छोटे हिस्सों में डाउनस्ट्रीम सिस्टम तक भेजा जाए। 5,000-पंक्ति के बैचों पर इटरेट करें और हर बैच का एक छोटा सा सारांश कैप्चर करें.
एक LazyFrame digital_rows, जिसमें फ़िल्टर किए गए डिजिटल checkouts हैं, पहले से लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Polars के साथ Data Pipelines का स्केलिंग और ऑप्टिमाइज़ेशन
अभ्यास निर्देश
- स्ट्रीमिंग इंजन पर
digital_rowsमें 5,000 पंक्तियों के बैचों में इटरेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
batch_summaries = []
# Stream digital_rows in chunks of 5,000
for batch_no, batch in enumerate(
digital_rows.____(chunk_size=____, engine="streaming"),
start=1,
):
batch_summaries.append(
{
"batch": batch_no,
"rows": batch.height,
"checkouts": batch["checkouts"].sum(),
}
)
result = pl.DataFrame(batch_summaries)
print(result)