Архитектурные паттерны конвейеров данных
При построении конвейеров данных рекомендуется разделять файлы, в которых определяются функции, и файлы, в которых они запускаются.
В этом упражнении вы потренируетесь импортировать компоненты конвейера в память, а затем использовать эти функции для запуска пайплайна от начала до конца. Проект имеет следующую структуру: в pipeline_utils хранятся функции extract(), transform() и load(), которые используются для запуска конвейера.
> ls
etl_pipeline.py
pipeline_utils.py
Это упражнение является частью курса
ETL и ELT на Python
Инструкции к упражнению
- Импортируйте функции
extract,transformиloadиз модуляpipeline_utils. - Используйте импортированные функции, чтобы запустить конвейер данных от начала до конца.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")