始める無料で始める

再起動後の処理再開

Global Retail Analytics のストリーミングパイプラインは、Unity Catalog ボリュームから新しい CSV ファイルを取得し、Delta Lake に書き込む処理を行っています。週末に障害が発生してクラスターが停止し、月曜日の朝に再起動しました。週末の間に新しいファイルが3つ到着していました。ストリームはその3ファイルのみを処理し、前の週のファイルは再読み込みされませんでした。

ストリームが処理済みのファイルをスキップし、中断した場所から正確に再開できるのはなぜでしょうか?

この演習はコースの一部です

Databricks における Spark SQL を使ったデータ変換

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する