Zacznij terazZacznij za darmo

Wzorce architektury potoków danych

Budując potoki danych, warto rozdzielać pliki, w których definiuje się funkcje, od tych, w których się je uruchamia.

W tym ćwiczeniu przećwiczysz importowanie komponentów potoku do pamięci, a następnie użyjesz tych funkcji, aby uruchomić potok od początku do końca. Projekt ma następującą strukturę – pipeline_utils przechowuje funkcje extract(), transform() i load(), które służą do uruchomienia potoku.

> ls
 etl_pipeline.py
 pipeline_utils.py

To ćwiczenie jest częścią kursu

ETL i ELT w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj funkcje extract, transform i load z modułu pipeline_utils.
  • Użyj zaimportowanych funkcji, aby uruchomić potok danych od początku do końca.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
Edytuj i uruchom kod