เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ID กับ partition ที่ต่างกัน

เพิ่งเสร็จสิ้นการเพิ่มฟิลด์ ID ให้กับ DataFrame แล้ว คราวนี้ลองดูว่าจะเกิดอะไรขึ้นเมื่อทำสิ่งเดียวกันกับ DataFrame ที่มีจำนวน partition แตกต่างกัน

หากต้องการตรวจสอบจำนวน partition ให้ใช้เมธอด .rdd.getNumPartitions() กับ DataFrame

ใน workspace มี session spark และ DataFrame สองตัว ได้แก่ voter_df และ voter_df_single คำแนะนำด้านล่างจะช่วยให้เห็นความแตกต่างระหว่าง DataFrame ทั้งสอง ไลบรารี pyspark.sql.functions พร้อมใช้งานภายใต้ชื่อย่อ F

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การทำความสะอาดข้อมูลด้วย PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แสดงจำนวน partition ของแต่ละ DataFrame
  • เพิ่มฟิลด์ ROW_ID ให้กับแต่ละ DataFrame
  • แสดง ID 10 รายการแรกของแต่ละ DataFrame

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)

# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____

# Show the top 10 IDs in each DataFrame 
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)
แก้ไขและรันโค้ด