Шаблони архітектури конвеєрів даних
Під час створення конвеєрів даних найкраще відокремлювати файли, у яких визначаються функції, від файлів, у яких вони запускаються.
У цій вправі ви потренуєтеся імпортувати компоненти конвеєра в пам'ять, а потім використаєте ці функції, щоб запустити конвеєр від початку до кінця. Проєкт має таку структуру: у pipeline_utils зберігаються функції extract(), transform() і load(), які буде використано для запуску конвеєра.
> ls
etl_pipeline.py
pipeline_utils.py
Ця вправа є частиною курсу
ETL та ELT у Python
Інструкції до вправи
- Імпортуйте функції
extract,transformіloadз модуляpipeline_utils. - Використайте імпортовані функції, щоб запустити конвеєр даних від початку до кінця.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")