เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

แปลง Spark DataFrame เป็น pandas

สมมติว่าคุณได้รันคิวรีบนชุดข้อมูลขนาดใหญ่และรวมผลลัพธ์ให้เหลือข้อมูลที่จัดการได้ง่ายขึ้นแล้ว

บางครั้งการนำตารางนั้นมาทำงานในเครื่องด้วยเครื่องมืออย่าง pandas ก็เป็นทางเลือกที่สมเหตุสมผล Spark DataFrame รองรับการทำแบบนี้ได้ง่ายๆ ผ่านเมธอด .toPandas() การเรียกเมธอดนี้บน Spark DataFrame จะคืนค่าเป็น pandas DataFrame ที่สอดคล้องกัน — ง่ายแค่นั้นเอง!

ในแบบฝึกหัดนี้ คิวรีจะนับจำนวนเที่ยวบินที่มุ่งหน้าไปยังแต่ละสนามบินจาก SEA และ PDX

จำไว้ว่ามี SparkSession ชื่อ spark พร้อมใช้งานใน workspace อยู่แล้ว!

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

พื้นฐาน PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • รันคิวรีโดยใช้เมธอด .sql() แล้วบันทึกผลลัพธ์ไว้ในตัวแปร flight_counts
  • ใช้เมธอด .toPandas() กับ flight_counts เพื่อสร้าง pandas DataFrame ชื่อ pd_counts
  • แสดงผล .head() ของ pd_counts ออกทางคอนโซล

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
แก้ไขและรันโค้ด