Zapisywanie oczyszczonego wyciągu do Parquet
Wracamy do danych biblioteki w Seattle. Zespół ma oczyszczony wyciąg wypożyczeń, który chce zapisać do formatu Parquet na potrzeby dalszych narzędzi — bez wcześniejszego wczytywania całości do pamięci. Zapisz leniwą kwerendę bezpośrednio na dysk.
clean_checkouts jest wczytane z wyprzedzeniem, podobnie jak ścieżka eksportu CLEAN_EXPORT_PATH.
To ćwiczenie jest częścią kursu
Skalowanie i optymalizacja potoków danych w Polars
Instrukcje do ćwiczenia
- Zapisz
clean_checkoutsdoCLEAN_EXPORT_PATHbezpośrednio z leniwej kwerendy. - Ustaw rozmiar grupy wierszy na 5 000.
- Użyj silnika strumieniowego.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)