Začněte nyníZačněte zdarma

Načítání Dask DataFrames z formátu Parquet

V 1. kapitole jsi analyzoval/a data ze Spotify rozdělená do více souborů a hledal/a nejpopulárnější hity z let 2005–2020. Tehdy jsi k tomu použil/a funkci dask.delayed() a smyčku. Teď se podíváme, o kolik jednodušší je stejná analýza s Dask DataFrames.

dask.dataframe je už naimportovaný jako dd.

Toto cvičení je součástí kurzu

Parallel Programming with Dask in Python

Zobrazit kurz

Pokyny k cvičení

  • Načti složku s daty ve formátu Parquet uloženou v "data/spotify_parquet".
  • Pomocí metody .nlargest() najdi 10 nejpopulárnějších písní podle sloupce 'popularity'.
  • Převeď odložený objekt na pandas DataFrame pomocí výpočtu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Upravit a spustit kód