Wzorce architektury potoków danych
Budując potoki danych, warto rozdzielać pliki, w których definiuje się funkcje, od tych, w których się je uruchamia.
W tym ćwiczeniu przećwiczysz importowanie komponentów potoku do pamięci, a następnie użyjesz tych funkcji, aby uruchomić potok od początku do końca. Projekt ma następującą strukturę – pipeline_utils przechowuje funkcje extract(), transform() i load(), które służą do uruchomienia potoku.
> ls
etl_pipeline.py
pipeline_utils.py
To ćwiczenie jest częścią kursu
ETL i ELT w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcje
extract,transformiloadz modułupipeline_utils. - Użyj zaimportowanych funkcji, aby uruchomić potok danych od początku do końca.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")