การเขียนข้อมูลลงไฟล์
จากวิดีโอ คุณได้เห็นแล้วว่าไฟล์มักถูกโหลดเข้าสู่ฐานข้อมูลแบบ MPP อย่าง Redshift เพื่อให้พร้อมสำหรับการวิเคราะห์
ขั้นตอนทั่วไปคือการเขียนข้อมูลลงในไฟล์ข้อมูลแบบคอลัมน์ จากนั้นไฟล์เหล่านี้จะถูกอัปโหลดไปยังระบบจัดเก็บข้อมูล และนำเข้าสู่ data warehouse ต่อไป ในกรณีของ Amazon Redshift ระบบจัดเก็บข้อมูลที่ใช้ เช่น S3
ขั้นตอนแรกคือการเขียนไฟล์ให้อยู่ในรูปแบบที่ถูกต้อง สำหรับแบบฝึกหัดนี้จะใช้รูปแบบไฟล์ Apache Parquet
ใน workspace มี PySpark DataFrame ชื่อ film_sdf และ pandas DataFrame ชื่อ film_pdf พร้อมใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Data Engineering เบื้องต้น
คำแนะนำการฝึกหัด
- เขียน pandas DataFrame
film_pdfลงในไฟล์ parquet ชื่อ"films_pdf.parquet" - เขียน PySpark DataFrame
film_sdfลงในไฟล์ parquet ชื่อ"films_sdf.parquet"
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")