Відновлення після перезапуску
Ваш потоковий конвеєр у Global Retail Analytics підбирає нові файли CSV з тому Unity Catalog і записує їх у Delta Lake. Після аварійної зупинки на вихідних кластер перезапускається у понеділок вранці. За вихідні зʼявилися три нові файли. Потік обробляє лише ці три файли — жоден з файлів попереднього тижня не перезавантажується.
Що дозволяє потоку пропускати вже оброблені файли та відновлюватися саме з того місця, де він зупинився?
Ця вправа є частиною курсу
Перетворення даних за допомогою Spark SQL у Databricks
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу