Citirea Dask DataFrames din Parquet
În Capitolul 1, ai analizat date Spotify distribuite în mai multe fișiere pentru a găsi cele mai populare piese din perioada 2005–2020. Ai realizat această analiză folosind funcția dask.delayed() și o buclă. Hai să vedem cât de mult se simplifică lucrurile atunci când folosești Dask DataFrames.
dask.dataframe a fost importat pentru tine ca dd.
Acest exercițiu face parte din cursul
Programare paralelă cu Dask în Python
Instrucțiuni pentru exercițiu
- Încarcă folderul cu date Parquet aflat la calea
"data/spotify_parquet". - Folosește metoda
.nlargest()a DataFrame-ului pentru a găsi primele 10 piese după'popularity'. - Convertește obiectul întârziat într-un DataFrame pandas calculând rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)