การ Join ข้อมูล ตอนที่ 2
ใน PySpark การ join ข้อมูลทำได้ผ่าน method .join() ของ DataFrame ซึ่งรับอาร์กิวเมนต์สามตัว ตัวแรกคือ DataFrame ที่สองที่ต้องการนำมา join ด้วย ตัวที่สองคือ on ซึ่งระบุชื่อคอลัมน์คีย์ในรูปแบบ string โดยคอลัมน์คีย์ต้องมีชื่อเหมือนกันในทั้งสองตาราง ตัวที่สามคือ how ซึ่งกำหนดประเภทของการ join ในคอร์สนี้จะใช้ค่า how="leftouter" เสมอ
ชุดข้อมูล flights และชุดข้อมูลใหม่ชื่อ airports ถูกโหลดไว้ใน workspace ของคุณแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐาน PySpark
คำแนะนำการฝึกหัด
- ดู DataFrame
airportsโดยเรียก.show()จากนั้นสังเกตว่าคอลัมน์คีย์ใดที่จะใช้ joinairportsกับตารางflights - เปลี่ยนชื่อคอลัมน์
faaในairportsเป็นdestโดยกำหนดผลลัพธ์ของairports.withColumnRenamed("faa", "dest")กลับไปที่ตัวแปรairports - Join
flightsกับ DataFrameairportsบนคอลัมน์destโดยเรียก method.join()บนflightsแล้วบันทึกผลลัพธ์เป็นflights_with_airports- อาร์กิวเมนต์แรกควรเป็น DataFrame อีกตัว คือ
airports - อาร์กิวเมนต์
onควรเป็นคอลัมน์คีย์ - อาร์กิวเมนต์
howควรเป็น"leftouter"
- อาร์กิวเมนต์แรกควรเป็น DataFrame อีกตัว คือ
- เรียก
.show()บนflights_with_airportsเพื่อตรวจสอบข้อมูล และสังเกตข้อมูลใหม่ที่ถูกเพิ่มเข้ามา
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)