เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ส่วนที่ 3: การแสดงผลข้อมูล

การแสดงผลข้อมูล (data visualization) มีความสำคัญอย่างมากในการวิเคราะห์ข้อมูลเชิงสำรวจ (EDA) PySpark DataFrame เหมาะกับการแสดงผลข้อมูลมากกว่า RDD เนื่องจากมีโครงสร้างและ schema ที่ชัดเจนในตัว

ในส่วนที่สามนี้ คุณจะสร้างฮิสโทแกรมของช่วงอายุของผู้เล่นทั้งหมดจากเยอรมนี โดยใช้ DataFrame ที่สร้างไว้ในแบบฝึกหัดก่อนหน้า โดยจะแปลง PySpark DataFrame เป็น Pandas DataFrame ก่อน แล้วจึงใช้ฟังก์ชัน plot() ของ matplotlib เพื่อสร้าง density plot ของช่วงอายุของผู้เล่นจากเยอรมนี

ทั้ง SparkSession spark, ตารางชั่วคราว fifa_df_table และ DataFrame fifa_df_germany_age มีพร้อมใช้งานใน workspace ของคุณแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แปลง fifa_df_germany_age ให้เป็น Pandas DataFrame ชื่อ fifa_df_germany_age_pandas
  • สร้าง density plot ของคอลัมน์ 'Age' จาก Pandas DataFrame fifa_df_germany_age_pandas

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()

# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()
แก้ไขและรันโค้ด