โหลดข้อมูลเที่ยวบิน
ในแบบฝึกหัดนี้ จะได้โหลดข้อมูลเที่ยวบินสายการบินจากไฟล์ CSV เพื่อให้แบบฝึกหัดทำงานได้รวดเร็ว ข้อมูลชุดนี้ถูกตัดทอนเหลือเพียง 50,000 เรคคอร์ด สามารถดาวน์โหลดชุดข้อมูลขนาดใหญ่กว่าในรูปแบบเดียวกันได้ ที่นี่
หมายเหตุเกี่ยวกับรูปแบบ CSV:
- ฟิลด์คั่นด้วยเครื่องหมายจุลภาค (ซึ่งเป็นตัวคั่นค่าเริ่มต้น)
- ข้อมูลที่หายไปแทนด้วยสตริง 'NA'
พจนานุกรมข้อมูล:
mon— เดือน (จำนวนเต็มระหว่าง 1 ถึง 12)dom— วันที่ในเดือน (จำนวนเต็มระหว่าง 1 ถึง 31)dow— วันในสัปดาห์ (จำนวนเต็ม; 1 = วันจันทร์ และ 7 = วันอาทิตย์)carrier— สายการบิน (รหัส IATA)flight— หมายเลขเที่ยวบินorg— สนามบินต้นทาง (รหัส IATA)mile— ระยะทาง (ไมล์)depart— เวลาออกเดินทาง (ชั่วโมงทศนิยม)duration— ระยะเวลาบินที่คาดการณ์ (นาที)delay— ความล่าช้า (นาที)
นำเข้า pyspark ให้แล้ว และเริ่มต้น session เรียบร้อยแล้ว
หมายเหตุ: ข้อมูลชุดนี้ถูกสุ่มตัวอย่างลงอย่างมาก
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning with PySpark
คำแนะนำการฝึกหัด
- อ่านข้อมูลจากไฟล์ CSV ชื่อ
flights.csvกำหนดชนิดข้อมูลให้คอลัมน์โดยอัตโนมัติ และจัดการกับข้อมูลที่หายไป - ชุดข้อมูลนี้มีเรคคอร์ดทั้งหมดกี่รายการ?
- ดูเรคคอร์ด 5 รายการแรก
- คอลัมน์ต่างๆ ถูกกำหนดชนิดข้อมูลอะไรบ้าง และดูสมเหตุสมผลหรือไม่?
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Read data from CSV file
flights = spark.____.____(____,
sep=____,
header=____,
inferSchema=____,
nullValue=____)
# Get number of records
print("The data contain %d records." % flights.____())
# View the first five records
flights.____(5)
# Check column data types
print(flights.____)