Zacznij terazZacznij za darmo

Wczytywanie Dask DataFrames z plików Parquet

W rozdziale 1. analizowałeś dane Spotify podzielone na wiele plików, aby znaleźć największe hity z lat 2005–2020. Do tego celu użyłeś funkcji dask.delayed() i pętli. Teraz sprawdź, o ile prostsze staje się to zadanie dzięki Dask DataFrames.

dask.dataframe jest już zaimportowany jako dd.

To ćwiczenie jest częścią kursu

Programowanie równoległe z Dask w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj folder z danymi Parquet znajdującymi się pod ścieżką "data/spotify_parquet".
  • Użyj metody .nlargest() na DataFrame, aby znaleźć 10 piosenek z najwyższą wartością kolumny 'popularity'.
  • Przekształć opóźniony obiekt w pandas DataFrame, wywołując jego obliczenie.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Read the spotify_parquet folder
df = ____

# Find the 10 most popular songs
top_10_songs = ____

# Convert the delayed result to a pandas DataFrame
top_10_songs_df = ____

print(top_10_songs_df)
Edytuj i uruchom kod