Hervatten na een herstart
Je streamingpipeline bij Global Retail Analytics pikt nieuwe CSV-bestanden op uit een Unity Catalog-volume en schrijft ze naar Delta Lake. Na een storing in het weekend start de cluster maandagochtend opnieuw op. Er zijn drie nieuwe bestanden binnengekomen in het weekend. De stream verwerkt alleen die drie bestanden — geen van de bestanden van de vorige week wordt opnieuw geladen.
Waardoor kan de stream eerder verwerkte bestanden overslaan en precies doorgaan waar hij was gebleven?
Deze oefening maakt deel uit van de cursus
Gegevens transformeren met Spark SQL in Databricks
Interactieve oefening met praktijkervaring
Zet theorie om in actie met een van onze interactieve oefeningen
Begin oefening