การกลับมาทำงานต่อหลังรีสตาร์ท
Streaming Pipeline ของคุณที่ Global Retail Analytics คอยดึงไฟล์ CSV ใหม่จาก Unity Catalog Volume และเขียนข้อมูลลง Delta Lake หลังจากระบบขัดข้องช่วงสุดสัปดาห์ คลัสเตอร์รีสตาร์ทในเช้าวันจันทร์ โดยมีไฟล์ใหม่เข้ามา 3 ไฟล์ระหว่างช่วงนั้น Stream ประมวลผลเฉพาะ 3 ไฟล์นั้น โดยไม่โหลดไฟล์จากสัปดาห์ก่อนซ้ำ
อะไรทำให้ Stream ข้ามไฟล์ที่ประมวลผลไปแล้วและกลับมาทำงานต่อจากจุดที่หยุดไว้ได้อย่างแม่นยำ?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การแปลงข้อมูลด้วย Spark SQL ใน Databricks
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด