อ่าน Dask DataFrames จาก Parquet
ในบทที่ 1 คุณได้วิเคราะห์ข้อมูล Spotify ที่กระจายอยู่ในหลายไฟล์ เพื่อค้นหาเพลงยอดนิยมระหว่างปี 2005–2020 โดยใช้ฟังก์ชัน dask.delayed() และลูป คราวนี้มาดูกันว่า Dask DataFrames จะทำให้การวิเคราะห์นี้ง่ายขึ้นแค่ไหน
ได้นำเข้า dask.dataframe ให้แล้วในชื่อ dd
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Parallel Programming with Dask in Python
คำแนะนำการฝึกหัด
- โหลดโฟลเดอร์ข้อมูล Parquet ที่อยู่ใน
"data/spotify_parquet" - ใช้เมธอด
.nlargest()ของ DataFrame เพื่อค้นหา 10 เพลงที่มีคะแนน'popularity'สูงสุด - แปลง delayed object ให้เป็น pandas DataFrame ด้วยการคำนวณผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)