मल्टीपल फ़ाइल्स स्कैन करना
टीम का checkout डेटा अब हर साल की एक-एक CSV में बँटा हुआ है (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). इन सालाना फ़ाइलों में लेगेसी कॉलम नाम usageclass और materialtype हैं. सभी फ़ाइलों को एक साथ एक लॉजिकल डेटासेट की तरह स्कैन करने के लिए एक ग्लोब पैटर्न का उपयोग करें, फिर physical-checkouts का सारांश बनाएँ.
polars pl के रूप में लोड है, और डायरेक्टरी MULTIFILE_DIR में है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Polars के साथ Data Pipelines का स्केलिंग और ऑप्टिमाइज़ेशन
अभ्यास निर्देश
MULTIFILE_DIRमें हरseattle_*.csvफ़ाइल को ग्लोब पैटर्न से स्कैन करें.- संयुक्त डेटासेट को
"Physical"checkouts तक फ़िल्टर करें, फिरmaterialtypeके आधार पर group करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)