НачатьНачать бесплатно

Архитектурные паттерны конвейеров данных

При построении конвейеров данных рекомендуется разделять файлы, в которых определяются функции, и файлы, в которых они запускаются.

В этом упражнении вы потренируетесь импортировать компоненты конвейера в память, а затем использовать эти функции для запуска пайплайна от начала до конца. Проект имеет следующую структуру: в pipeline_utils хранятся функции extract(), transform() и load(), которые используются для запуска конвейера.

> ls
 etl_pipeline.py
 pipeline_utils.py

Это упражнение является частью курса

ETL и ELT на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функции extract, transform и load из модуля pipeline_utils.
  • Используйте импортированные функции, чтобы запустить конвейер данных от начала до конца.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
Редактировать и запускать код