Parquet から Dask DataFrame を読み込む
第1章では、2005〜2020年のトップヒットを見つけるため、複数ファイルに分割された Spotify データを分析しました。そこで は dask.delayed() とループを使いました。ここでは、Dask DataFrame を使うとこの分析がどれだけ簡単になるかを確認します。
dask.dataframe は dd としてインポート済みです。
この演習はコースの一部です
Pythonで学ぶDaskによる並列プログラミング
演習の手順
"data/spotify_parquet"にある Parquet データフォルダを読み込みます。- DataFrame の
.nlargest()メソッドを使って、'popularity'で上位10曲を取得します。 - 遅延オブジェクトを計算して、pandas の DataFrame に変換します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)