ส่วนที่ 1: สร้าง DataFrame จากไฟล์ CSV
ทุก 4 ปี แฟนฟุตบอลทั่วโลกจะรอคอยมหกรรม "ฟีฟ่า เวิลด์ คัพ" ซึ่งส่งผลให้หลายประเทศเปลี่ยนแปลงไปอย่างเห็นได้ชัด ในแบบฝึกหัด 3 ส่วนนี้ คุณจะทำการวิเคราะห์ข้อมูลเชิงสำรวจ (EDA) บนชุดข้อมูล "FIFA 2018 World Cup Player" โดยใช้ PySpark SQL ซึ่งครอบคลุมการดำเนินการกับ DataFrame คิวรี SQL และการแสดงผลข้อมูล
ในส่วนแรก จะโหลดชุดข้อมูลนักฟุตบอล FIFA 2018 World Cup (Fifa2018_dataset.csv) ซึ่งอยู่ในรูปแบบ CSV เข้าสู่ DataFrame ของ PySpark จากนั้นตรวจสอบข้อมูลด้วยการดำเนินการพื้นฐานของ DataFrame
ข้อควรทราบ: มี SparkSession spark และตัวแปร file_path พร้อมใช้งานใน workspace อยู่แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- สร้าง PySpark DataFrame จาก
file_path(ซึ่งเป็น path ไปยังไฟล์Fifa2018_dataset.csv) - แสดง schema ของ DataFrame
- แสดงข้อมูล 10 แถวแรก
- DataFrame นี้มีจำนวนแถวทั้งหมดเท่าใด?
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)
# Check the schema of columns
fifa_df.____()
# Show the first 10 observations
fifa_df.____(____)
# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))