เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

อ่าน Dask DataFrames จาก Parquet

ในบทที่ 1 คุณได้วิเคราะห์ข้อมูล Spotify ที่กระจายอยู่ในหลายไฟล์ เพื่อค้นหาเพลงยอดนิยมระหว่างปี 2005–2020 โดยใช้ฟังก์ชัน dask.delayed() และลูป คราวนี้มาดูกันว่า Dask DataFrames จะทำให้การวิเคราะห์นี้ง่ายขึ้นแค่ไหน

ได้นำเข้า dask.dataframe ให้แล้วในชื่อ dd

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Parallel Programming with Dask in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลดโฟลเดอร์ข้อมูล Parquet ที่อยู่ใน "data/spotify_parquet"
  • ใช้เมธอด .nlargest() ของ DataFrame เพื่อค้นหา 10 เพลงที่มีคะแนน 'popularity' สูงสุด
  • แปลง delayed object ให้เป็น pandas DataFrame ด้วยการคำนวณผลลัพธ์

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
แก้ไขและรันโค้ด