Bắt đầu ngayBắt đầu miễn phí

Đọc Dask DataFrame từ Parquet

Ở Chương 1, bạn đã phân tích một số dữ liệu Spotify được chia nhỏ thành nhiều tệp để tìm các bản hit hàng đầu giai đoạn 2005-2020. Bạn làm điều này bằng cách dùng hàm dask.delayed() và một vòng lặp. Hãy xem phân tích này sẽ dễ hơn bao nhiêu khi dùng Dask DataFrame.

dask.dataframe đã được nhập sẵn với bí danh dd.

Bài tập này là một phần của khóa học

Lập trình song song với Dask trong Python

Xem khóa học

Hướng dẫn bài tập

  • Tải thư mục dữ liệu Parquet nằm tại "data/spotify_parquet".
  • Dùng phương thức .nlargest() của DataFrame để tìm 10 bài hát đứng đầu theo 'popularity'.
  • Chuyển đối tượng delayed thành pandas DataFrame bằng cách tính toán nó.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Chỉnh sửa và Chạy Mã