แปลง Spark DataFrame เป็น pandas
สมมติว่าคุณได้รันคิวรีบนชุดข้อมูลขนาดใหญ่และรวมผลลัพธ์ให้เหลือข้อมูลที่จัดการได้ง่ายขึ้นแล้ว
บางครั้งการนำตารางนั้นมาทำงานในเครื่องด้วยเครื่องมืออย่าง pandas ก็เป็นทางเลือกที่สมเหตุสมผล Spark DataFrame รองรับการทำแบบนี้ได้ง่ายๆ ผ่านเมธอด .toPandas() การเรียกเมธอดนี้บน Spark DataFrame จะคืนค่าเป็น pandas DataFrame ที่สอดคล้องกัน — ง่ายแค่นั้นเอง!
ในแบบฝึกหัดนี้ คิวรีจะนับจำนวนเที่ยวบินที่มุ่งหน้าไปยังแต่ละสนามบินจาก SEA และ PDX
จำไว้ว่ามี SparkSession ชื่อ spark พร้อมใช้งานใน workspace อยู่แล้ว!
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐาน PySpark
คำแนะนำการฝึกหัด
- รันคิวรีโดยใช้เมธอด
.sql()แล้วบันทึกผลลัพธ์ไว้ในตัวแปรflight_counts - ใช้เมธอด
.toPandas()กับflight_countsเพื่อสร้างpandasDataFrame ชื่อpd_counts - แสดงผล
.head()ของpd_countsออกทางคอนโซล
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)