เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ส่วนที่ 1: สร้าง DataFrame จากไฟล์ CSV

ทุก 4 ปี แฟนฟุตบอลทั่วโลกจะรอคอยมหกรรม "ฟีฟ่า เวิลด์ คัพ" ซึ่งส่งผลให้หลายประเทศเปลี่ยนแปลงไปอย่างเห็นได้ชัด ในแบบฝึกหัด 3 ส่วนนี้ คุณจะทำการวิเคราะห์ข้อมูลเชิงสำรวจ (EDA) บนชุดข้อมูล "FIFA 2018 World Cup Player" โดยใช้ PySpark SQL ซึ่งครอบคลุมการดำเนินการกับ DataFrame คิวรี SQL และการแสดงผลข้อมูล

ในส่วนแรก จะโหลดชุดข้อมูลนักฟุตบอล FIFA 2018 World Cup (Fifa2018_dataset.csv) ซึ่งอยู่ในรูปแบบ CSV เข้าสู่ DataFrame ของ PySpark จากนั้นตรวจสอบข้อมูลด้วยการดำเนินการพื้นฐานของ DataFrame

ข้อควรทราบ: มี SparkSession spark และตัวแปร file_path พร้อมใช้งานใน workspace อยู่แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง PySpark DataFrame จาก file_path (ซึ่งเป็น path ไปยังไฟล์ Fifa2018_dataset.csv)
  • แสดง schema ของ DataFrame
  • แสดงข้อมูล 10 แถวแรก
  • DataFrame นี้มีจำนวนแถวทั้งหมดเท่าใด?

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
แก้ไขและรันโค้ด