Сквозное тестирование конвейера данных
В этом упражнении вы будете работать с тем же конвейером данных, что и раньше: он извлекает, преобразует и загружает налоговые данные. Вы попрактикуетесь в сквозном тестировании этого конвейера, чтобы убедиться, что его можно запускать несколько раз подряд без дублирования преобразованных данных в parquet-файле.
pandas загружен как pd, а функции extract(), transform() и load() уже определены.
Это упражнение является частью курса
ETL и ELT на Python
Инструкции к упражнению
- Запустите ETL-конвейер три раза с помощью цикла
for. - Выводите форму (shape)
clean_tax_dataна каждой итерации запуска конвейера. - Считайте DataFrame из файла
"clean_tax_data.parquet"в переменнуюto_validate. - Выведите форму (shape) DataFrame
to_validateи сравните её с формойclean_tax_rate, чтобы убедиться, что данные не дублировались при каждом запуске конвейера.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")