ส่วนที่ 3: การแสดงผลข้อมูล
การแสดงผลข้อมูล (data visualization) มีความสำคัญอย่างมากในการวิเคราะห์ข้อมูลเชิงสำรวจ (EDA) PySpark DataFrame เหมาะกับการแสดงผลข้อมูลมากกว่า RDD เนื่องจากมีโครงสร้างและ schema ที่ชัดเจนในตัว
ในส่วนที่สามนี้ คุณจะสร้างฮิสโทแกรมของช่วงอายุของผู้เล่นทั้งหมดจากเยอรมนี โดยใช้ DataFrame ที่สร้างไว้ในแบบฝึกหัดก่อนหน้า โดยจะแปลง PySpark DataFrame เป็น Pandas DataFrame ก่อน แล้วจึงใช้ฟังก์ชัน plot() ของ matplotlib เพื่อสร้าง density plot ของช่วงอายุของผู้เล่นจากเยอรมนี
ทั้ง SparkSession spark, ตารางชั่วคราว fifa_df_table และ DataFrame fifa_df_germany_age มีพร้อมใช้งานใน workspace ของคุณแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- แปลง
fifa_df_germany_ageให้เป็น Pandas DataFrame ชื่อfifa_df_germany_age_pandas - สร้าง density plot ของคอลัมน์ 'Age' จาก Pandas DataFrame
fifa_df_germany_age_pandas
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Convert fifa_df to fifa_df_germany_age_pandas DataFrame
fifa_df_germany_age_pandas = fifa_df_germany_age.____()
# Plot the 'Age' density of Germany Players
____.plot(kind='density')
plt.show()