НачатьНачать бесплатно

Сквозное тестирование конвейера данных

В этом упражнении вы будете работать с тем же конвейером данных, что и раньше: он извлекает, преобразует и загружает налоговые данные. Вы попрактикуетесь в сквозном тестировании этого конвейера, чтобы убедиться, что его можно запускать несколько раз подряд без дублирования преобразованных данных в parquet-файле.

pandas загружен как pd, а функции extract(), transform() и load() уже определены.

Это упражнение является частью курса

ETL и ELT на Python

Посмотреть курс

Инструкции к упражнению

  • Запустите ETL-конвейер три раза с помощью цикла for.
  • Выводите форму (shape) clean_tax_data на каждой итерации запуска конвейера.
  • Считайте DataFrame из файла "clean_tax_data.parquet" в переменную to_validate.
  • Выведите форму (shape) DataFrame to_validate и сравните её с формой clean_tax_rate, чтобы убедиться, что данные не дублировались при каждом запуске конвейера.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
Редактировать и запускать код