Reprendre après un redémarrage
Votre pipeline de diffusion en continu chez Global Retail Analytics récupère de nouveaux fichiers CSV à partir d'un volume Unity Catalog et les écrit dans Delta Lake. Après une panne pendant la fin de semaine, le grappe redémarre le lundi matin. Trois nouveaux fichiers sont arrivés pendant la fin de semaine. Le flux ne traite que ces trois fichiers — aucun fichier de la semaine précédente n'est rechargé.
Qu'est-ce qui permet au flux d'ignorer les fichiers déjà traités et de reprendre exactement où il s'était arrêté ?
Cette activité fait partie du cours
Transformation des données avec Spark SQL dans Databricks
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice