LoslegenKostenlos starten

Einen Parquet-Snapshot schreiben

Ein nachgelagertes Dashboard braucht einen schlankeren Parquet-Snapshot der digitalen E‑Book‑Aktivität. Baue das Ergebnis lazy auf und schreibe es anschließend mit expliziter Komprimierung und Row‑Group‑Einstellungen zurück, um die Datei für schnelle Reads zu optimieren.

Das LazyFrame requests ist verfügbar, und der Exportpfad steht in PARQUET_EXPORT_PATH.

Diese Übung ist Teil des Kurses

<Kurs>Skalieren und Optimieren von Data-Pipelines mit Polars</Kurs>
Kurs ansehen

Übungsanweisungen

  • Behalte für den Snapshot nur die ersten 500 digitalen Zeilen.
  • Setze compression_level beim Schreiben der Parquet-Datei auf 5.
  • Setze row_group_size auf 250 Zeilen.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

result = (
    requests
    .filter(pl.col("use") == "Digital")
    .select("date", "format", "checkouts", "title")
    # Keep only the first 500 rows
    .____(500)
    .collect()
)

result.write_parquet(
    PARQUET_EXPORT_PATH,
    # Set compression level to 5
    compression_level=____,
    # Set 250 rows per row group
    row_group_size=____,
)

print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))
Code bearbeiten und ausführen