始める無料で始める

Parquet から Dask DataFrame を読み込む

第1章では、2005〜2020年のトップヒットを見つけるため、複数ファイルに分割された Spotify データを分析しました。そこで は dask.delayed() とループを使いました。ここでは、Dask DataFrame を使うとこの分析がどれだけ簡単になるかを確認します。

dask.dataframedd としてインポート済みです。

この演習はコースの一部です

Pythonで学ぶDaskによる並列プログラミング

コースを見る

演習の手順

  • "data/spotify_parquet" にある Parquet データフォルダを読み込みます。
  • DataFrame の .nlargest() メソッドを使って、'popularity' で上位10曲を取得します。
  • 遅延オブジェクトを計算して、pandas の DataFrame に変換します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
コードを編集して実行