Načítání Dask DataFrames z formátu Parquet
V 1. kapitole jsi analyzoval/a data ze Spotify rozdělená do více souborů a hledal/a nejpopulárnější hity z let 2005–2020. Tehdy jsi k tomu použil/a funkci dask.delayed() a smyčku. Teď se podíváme, o kolik jednodušší je stejná analýza s Dask DataFrames.
dask.dataframe je už naimportovaný jako dd.
Toto cvičení je součástí kurzu
Parallel Programming with Dask in Python
Pokyny k cvičení
- Načti složku s daty ve formátu Parquet uloženou v
"data/spotify_parquet". - Pomocí metody
.nlargest()najdi 10 nejpopulárnějších písní podle sloupce'popularity'. - Převeď odložený objekt na pandas DataFrame pomocí výpočtu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Read the spotify_parquet folder
df = ____
# Find the 10 most popular songs
top_10_songs = ____
# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____
print(top_10_songs_df)