Skriva en Parquet-ögonblicksbild
En nedströms dashboard behöver en kompaktare Parquet-ögonblicksbild av aktivitet för digitala e-böcker. Bygg resultatet lazily och skriv sedan ut det med explicita inställningar för komprimering och radgrupsstorlek för att optimera filen för snabb läsning.
LazyFrame:en requests är tillgänglig och exportsökvägen finns i PARQUET_EXPORT_PATH.
Den här övningen är en del av kursen
Skalning och optimering av datapipelines med Polars
Övningsinstruktioner
- Behåll bara de första 500 digitala raderna för ögonblicksbilden.
- Ange
compression_leveltill5när du skriver Parquet-filen. - Ange
row_group_sizetill250rader.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
result = (
requests
.filter(pl.col("use") == "Digital")
.select("date", "format", "checkouts", "title")
# Keep only the first 500 rows
.____(500)
.collect()
)
result.write_parquet(
PARQUET_EXPORT_PATH,
# Set compression level to 5
compression_level=____,
# Set 250 rows per row group
row_group_size=____,
)
print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))