Elaborare i risultati della query a batch
Il team vuole inviare le righe dei checkout digitali a un sistema a valle in blocchi, invece di raccogliere un unico grande DataFrame. Itera in batch da 5.000 righe e acquisisci un piccolo riepilogo di ciascuno.
Un LazyFrame digital_rows con i checkout digitali filtrati è già caricato.
Questo esercizio fa parte del corso
Scalare e ottimizzare le pipeline di dati con Polars
Istruzioni dell'esercizio
- Itera su
digital_rowsin batch da 5.000 righe usando lo streaming engine.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
batch_summaries = []
# Stream digital_rows in chunks of 5,000
for batch_no, batch in enumerate(
digital_rows.____(chunk_size=____, engine="streaming"),
start=1,
):
batch_summaries.append(
{
"batch": batch_no,
"rows": batch.height,
"checkouts": batch["checkouts"].sum(),
}
)
result = pl.DataFrame(batch_summaries)
print(result)