Kom igångKom igång gratis

Läs Dask DataFrames från Parquet

I kapitel 1 analyserade du Spotify-data som var uppdelad över flera filer för att hitta de mest populära låtarna 2005–2020. Det gjorde du med funktionen dask.delayed() och en slinga. Nu ska vi se hur mycket enklare samma analys blir med Dask DataFrames.

dask.dataframe har importerats åt dig som dd.

Den här övningen är en del av kursen

Parallellprogrammering med Dask i Python

Visa kurs

Övningsinstruktioner

  • Läs in Parquet-datamappen som finns under "data/spotify_parquet".
  • Använd DataFrame-metoden .nlargest() för att hitta de 10 mest populära låtarna baserat på kolumnen 'popularity'.
  • Konvertera det fördröjda objektet till en pandas DataFrame genom att beräkna det.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Redigera och kör kod