Тестування конвеєра даних від початку до кінця
У цій вправі ви працюватимете з тим самим конвеєром даних, що й раніше, який виконує витягування, перетворення та завантаження податкових даних. Ви потренуєтеся тестувати цей конвеєр від початку до кінця, щоб переконатися, що розв'язок можна запускати кілька разів без дублювання перетворених даних у файлі parquet.
pandas імпортовано як pd, а функції extract(), transform() і load() уже визначено.
Ця вправа є частиною курсу
ETL та ELT у Python
Інструкції до вправи
- Запустіть ETL-конвеєр тричі, використавши цикл
for. - Виведіть розмір
clean_tax_dataна кожній ітерації запуску конвеєра. - Зчитайте датафрейм, збережений у файлі
"clean_tax_data.parquet", у зміннуto_validate. - Виведіть розмір датафрейму
to_validate, порівнявши його з розміромclean_tax_rate, щоб переконатися, що під час кожного запуску конвеєра дані не дублювалися.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")