Riprendere dopo un riavvio
La tua pipeline di streaming in Global Retail Analytics preleva nuovi file CSV da un volume di Unity Catalog e li scrive in Delta Lake. Dopo un'interruzione nel weekend, il cluster si riavvia lunedì mattina. Nel frattempo sono arrivati tre nuovi file. Lo stream elabora solo quei tre file: nessuno dei file della settimana precedente viene ricaricato.
Cosa permette allo stream di saltare i file già elaborati e riprendere esattamente da dove si era fermato?
Questo esercizio fa parte del corso
Trasformazione dei dati con Spark SQL in Databricks
esercizio interattivo pratico
Trasforma la teoria in pratica con uno dei nostri esercizi interattivi
Inizia esercizio