เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ Join ข้อมูล ตอนที่ 2

ใน PySpark การ join ข้อมูลทำได้ผ่าน method .join() ของ DataFrame ซึ่งรับอาร์กิวเมนต์สามตัว ตัวแรกคือ DataFrame ที่สองที่ต้องการนำมา join ด้วย ตัวที่สองคือ on ซึ่งระบุชื่อคอลัมน์คีย์ในรูปแบบ string โดยคอลัมน์คีย์ต้องมีชื่อเหมือนกันในทั้งสองตาราง ตัวที่สามคือ how ซึ่งกำหนดประเภทของการ join ในคอร์สนี้จะใช้ค่า how="leftouter" เสมอ

ชุดข้อมูล flights และชุดข้อมูลใหม่ชื่อ airports ถูกโหลดไว้ใน workspace ของคุณแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

พื้นฐาน PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ดู DataFrame airports โดยเรียก .show() จากนั้นสังเกตว่าคอลัมน์คีย์ใดที่จะใช้ join airports กับตาราง flights
  • เปลี่ยนชื่อคอลัมน์ faa ใน airports เป็น dest โดยกำหนดผลลัพธ์ของ airports.withColumnRenamed("faa", "dest") กลับไปที่ตัวแปร airports
  • Join flights กับ DataFrame airports บนคอลัมน์ dest โดยเรียก method .join() บน flights แล้วบันทึกผลลัพธ์เป็น flights_with_airports
    • อาร์กิวเมนต์แรกควรเป็น DataFrame อีกตัว คือ airports
    • อาร์กิวเมนต์ on ควรเป็นคอลัมน์คีย์
    • อาร์กิวเมนต์ how ควรเป็น "leftouter"
  • เรียก .show() บน flights_with_airports เพื่อตรวจสอบข้อมูล และสังเกตข้อมูลใหม่ที่ถูกเพิ่มเข้ามา

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
แก้ไขและรันโค้ด