นับความนิยมของแต่ละแนวภาพยนตร์
เพื่อค้นหาแนวภาพยนตร์ที่พบบ่อยที่สุดในแคตาล็อก ให้ปรับรูปแบบคอลัมน์ list ชื่อ genres เพื่อให้แต่ละแนวภาพยนตร์มีแถวเป็นของตัวเอง จากนั้นคำนวณจำนวนที่เรียงลำดับแล้วเพื่อดูว่าแนวใดติดอันดับสูงสุด
DataFrame movies ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การปรับขนาดและเพิ่มประสิทธิภาพ Data Pipeline ด้วย Polars
คำแนะนำการฝึกหัด
- Explode คอลัมน์ list ชื่อ
genresเพื่อให้แต่ละแนวภาพยนตร์มีแถวของตัวเอง - คำนวณ 10 แนวภาพยนตร์ที่พบบ่อยที่สุดโดยใช้ value count แบบเรียงลำดับ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Put each genre on its own row
genres = movies.select("genres").____("genres")["genres"]
# Rank by frequency
result = genres.drop_nulls().____(sort=True).head(10)
print(result)