เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การเขียนข้อมูลลงไฟล์

จากวิดีโอ คุณได้เห็นแล้วว่าไฟล์มักถูกโหลดเข้าสู่ฐานข้อมูลแบบ MPP อย่าง Redshift เพื่อให้พร้อมสำหรับการวิเคราะห์

ขั้นตอนทั่วไปคือการเขียนข้อมูลลงในไฟล์ข้อมูลแบบคอลัมน์ จากนั้นไฟล์เหล่านี้จะถูกอัปโหลดไปยังระบบจัดเก็บข้อมูล และนำเข้าสู่ data warehouse ต่อไป ในกรณีของ Amazon Redshift ระบบจัดเก็บข้อมูลที่ใช้ เช่น S3

ขั้นตอนแรกคือการเขียนไฟล์ให้อยู่ในรูปแบบที่ถูกต้อง สำหรับแบบฝึกหัดนี้จะใช้รูปแบบไฟล์ Apache Parquet

ใน workspace มี PySpark DataFrame ชื่อ film_sdf และ pandas DataFrame ชื่อ film_pdf พร้อมใช้งานแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Data Engineering เบื้องต้น

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เขียน pandas DataFrame film_pdf ลงในไฟล์ parquet ชื่อ "films_pdf.parquet"
  • เขียน PySpark DataFrame film_sdf ลงในไฟล์ parquet ชื่อ "films_sdf.parquet"

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
แก้ไขและรันโค้ด