Wznawianie po restarcie
Twój potok strumieniowania w firmie Global Retail Analytics pobiera nowe pliki CSV z wolumenu Unity Catalog i zapisuje je do Delta Lake. Po weekendowej awarii klaster restartuje się w poniedziałek rano. Przez weekend pojawiły się trzy nowe pliki. Strumień przetwarza tylko te trzy pliki — żaden plik z poprzedniego tygodnia nie jest ponownie wczytywany.
Co sprawia, że strumień pomija już przetworzone pliki i wznawia działanie dokładnie w miejscu, w którym skończył?
To ćwiczenie jest częścią kursu
Data Transformation with Spark SQL in Databricks
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie