เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การรวมข้อมูล (Aggregating)

เมธอดการรวมข้อมูลทั่วไป เช่น .min(), .max() และ .count() ล้วนเป็นเมธอดของ GroupedData ซึ่งสร้างขึ้นด้วยการเรียกเมธอด .groupBy() บน DataFrame จะได้เรียนรู้รายละเอียดเพิ่มเติมในแบบฝึกหัดถัดๆ ไป สำหรับตอนนี้ เพียงเรียกเมธอดดังกล่าวบน DataFrame ก็พร้อมใช้งานได้เลย ตัวอย่างเช่น หากต้องการหาค่าต่ำสุดของคอลัมน์ col ใน DataFrame ชื่อ df ทำได้ดังนี้

df.groupBy().min("col").show()

โค้ดนี้จะสร้างออบเจ็กต์ GroupedData (เพื่อให้ใช้เมธอด .min() ได้) จากนั้นหาค่าต่ำสุดในคอลัมน์ col แล้วคืนค่าเป็น DataFrame

ตอนนี้พร้อมลองทำการรวมข้อมูลด้วยตัวเองแล้ว!

ในพื้นที่ทำงานมี SparkSession ชื่อ spark และ Spark DataFrame ชื่อ flights พร้อมใช้งานอยู่แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

พื้นฐาน PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • หาความยาวของเที่ยวบินที่สั้นที่สุด (วัดจากระยะทาง) ที่ออกจาก PDX โดยใช้ .filter() ร่วมกับเมธอด .min() ทำการกรองโดยอ้างอิงคอลัมน์โดยตรง ไม่ใช่การส่ง SQL string
  • หาความยาวของเที่ยวบินที่ยาวที่สุด (วัดจากเวลา) ที่ออกจาก SEA โดยใช้ filter() ร่วมกับเมธอด .max() ทำการกรองโดยอ้างอิงคอลัมน์โดยตรง ไม่ใช่การส่ง SQL string

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Find the shortest flight from PDX in terms of distance
flights.filter(____.____ == ____).groupBy().____(____).show()

# Find the longest flight from SEA in terms of air time
flights.filter(____).groupBy().____.show()
แก้ไขและรันโค้ด