Потоковая загрузка розничных данных в Delta Lake
Каждый день в хранилище вашей команды Global Retail Analytics появляются новые файлы с заказами.
Вместо того чтобы каждое утро перезагружать все данные заново, вы создадите потоковый пайплайн: он будет автоматически подхватывать новые CSV-файлы, записывать их в Delta Lake и корректно восстанавливаться после перезапуска с помощью чекпоинтов.
Это упражнение является частью курса
Преобразование данных с помощью Spark SQL в Databricks
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение