เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

โหลดข้อมูลเที่ยวบิน

ในแบบฝึกหัดนี้ จะได้โหลดข้อมูลเที่ยวบินสายการบินจากไฟล์ CSV เพื่อให้แบบฝึกหัดทำงานได้รวดเร็ว ข้อมูลชุดนี้ถูกตัดทอนเหลือเพียง 50,000 เรคคอร์ด สามารถดาวน์โหลดชุดข้อมูลขนาดใหญ่กว่าในรูปแบบเดียวกันได้ ที่นี่

หมายเหตุเกี่ยวกับรูปแบบ CSV:

  • ฟิลด์คั่นด้วยเครื่องหมายจุลภาค (ซึ่งเป็นตัวคั่นค่าเริ่มต้น)
  • ข้อมูลที่หายไปแทนด้วยสตริง 'NA'

พจนานุกรมข้อมูล:

  • mon — เดือน (จำนวนเต็มระหว่าง 1 ถึง 12)
  • dom — วันที่ในเดือน (จำนวนเต็มระหว่าง 1 ถึง 31)
  • dow — วันในสัปดาห์ (จำนวนเต็ม; 1 = วันจันทร์ และ 7 = วันอาทิตย์)
  • carrier — สายการบิน (รหัส IATA)
  • flight — หมายเลขเที่ยวบิน
  • org — สนามบินต้นทาง (รหัส IATA)
  • mile — ระยะทาง (ไมล์)
  • depart — เวลาออกเดินทาง (ชั่วโมงทศนิยม)
  • duration — ระยะเวลาบินที่คาดการณ์ (นาที)
  • delay — ความล่าช้า (นาที)

นำเข้า pyspark ให้แล้ว และเริ่มต้น session เรียบร้อยแล้ว

หมายเหตุ: ข้อมูลชุดนี้ถูกสุ่มตัวอย่างลงอย่างมาก

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • อ่านข้อมูลจากไฟล์ CSV ชื่อ flights.csv กำหนดชนิดข้อมูลให้คอลัมน์โดยอัตโนมัติ และจัดการกับข้อมูลที่หายไป
  • ชุดข้อมูลนี้มีเรคคอร์ดทั้งหมดกี่รายการ?
  • ดูเรคคอร์ด 5 รายการแรก
  • คอลัมน์ต่างๆ ถูกกำหนดชนิดข้อมูลอะไรบ้าง และดูสมเหตุสมผลหรือไม่?

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
แก้ไขและรันโค้ด