Einen Parquet-Snapshot schreiben
Ein nachgelagertes Dashboard braucht einen schlankeren Parquet-Snapshot der digitalen E‑Book‑Aktivität. Baue das Ergebnis lazy auf und schreibe es anschließend mit expliziter Komprimierung und Row‑Group‑Einstellungen zurück, um die Datei für schnelle Reads zu optimieren.
Das LazyFrame requests ist verfügbar, und der Exportpfad steht in PARQUET_EXPORT_PATH.
Diese Übung ist Teil des Kurses
<Kurs>Skalieren und Optimieren von Data-Pipelines mit Polars</Kurs>Übungsanweisungen
- Behalte für den Snapshot nur die ersten 500 digitalen Zeilen.
- Setze
compression_levelbeim Schreiben der Parquet-Datei auf5. - Setze
row_group_sizeauf250Zeilen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
result = (
requests
.filter(pl.col("use") == "Digital")
.select("date", "format", "checkouts", "title")
# Keep only the first 500 rows
.____(500)
.collect()
)
result.write_parquet(
PARQUET_EXPORT_PATH,
# Set compression level to 5
compression_level=____,
# Set 250 rows per row group
row_group_size=____,
)
print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))