ÎncepețiÎncepe gratuit

Citirea Dask DataFrames din Parquet

În Capitolul 1, ai analizat date Spotify distribuite în mai multe fișiere pentru a găsi cele mai populare piese din perioada 2005–2020. Ai realizat această analiză folosind funcția dask.delayed() și o buclă. Hai să vedem cât de mult se simplifică lucrurile atunci când folosești Dask DataFrames.

dask.dataframe a fost importat pentru tine ca dd.

Acest exercițiu face parte din cursul

Programare paralelă cu Dask în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă folderul cu date Parquet aflat la calea "data/spotify_parquet".
  • Folosește metoda .nlargest() a DataFrame-ului pentru a găsi primele 10 piese după 'popularity'.
  • Convertește obiectul întârziat într-un DataFrame pandas calculând rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Editează și rulează codul